Tutorial: Mengambil data Azure Event Hubs dalam format Parquet dan menganalisis dengan Azure Synapse Analytics

Azure Event Hubs menghasilkan data streaming dalam volume besar yang sering kali perlu Anda simpan untuk analisis. Tutorial ini menunjukkan kepada Anda cara mengambil data tersebut dalam format Parquet - format penyimpanan kolom yang dioptimalkan untuk beban kerja analitik - dengan menggunakan Azure Stream Analytics tanpa menulis kode apa pun.

Gunakan editor tanpa kode Azure Stream Analytics untuk membangun pekerjaan yang mengalirkan data dari Azure Event Hubs langsung ke Azure Data Lake Storage Gen2. Kemudian, kueri file Parquet yang diambil dengan menggunakan Azure Synapse Analytics dengan Spark dan SQL tanpa server.

Dalam tutorial ini, Anda akan mempelajari cara:

  • Menyebarkan generator peristiwa yang mengirim peristiwa sampel ke pusat aktivitas
  • Buat pekerjaan Stream Analytics dengan menggunakan editor tanpa kode
  • Meninjau data input dan skema
  • Mengonfigurasi Azure Data Lake Storage Gen2 untuk menangkap data Event Hub
  • Jalankan tugas Analisis Aliran
  • Menggunakan Azure Synapse Analytics untuk mengkueri file Parquet

Prasyarat

Sebelum memulai, pastikan Anda menyelesaikan langkah-langkah berikut:

Gunakan editor tanpa kode untuk membuat pekerjaan Analisis Aliran

  1. Temukan grup sumber daya tempat Anda menyebarkan generator peristiwa TollApp.

  2. Pilih namespace Azure Event Hubs. Anda mungkin ingin membukanya di tab terpisah atau jendela.

    Cuplikan layar memperlihatkan pemilihan namespace Layanan Pusat Aktivitas di grup sumber daya.

  3. Pada halaman namespace layanan Azure Event Hubs , pilih Azure Event Hubs di bawah Entitas di menu sebelah kiri.

  4. Pilih entrystream instance.

    Cuplikan layar memperlihatkan pemilihan pusat aktivitas.

  5. Pada halaman instans Azure Event Hubs , pilih Proses data di bagian Fitur di menu sebelah kiri.

  6. Pilih Mulai pada petak peta Ambil data ke ADLS Gen2 dalam format Parket.

    Cuplikan layar memperlihatkan pilihan petak peta **Ambil data ke ADLS Gen2 dalam format Parquet**.

  7. Beri nama pekerjaan parquetcapture Anda dan pilih Buat.

    Cuplikan layar halaman pekerjaan Analisis Aliran Baru.

  8. Pada halaman konfigurasi pusat aktivitas, ikuti langkah-langkah berikut:

    1. Untuk Grup konsumen, pilih Gunakan yang sudah ada.

    2. Konfirmasikan bahwa $Default grup konsumen dipilih.

    3. Konfirmasikan bahwa Serialisasi diatur ke JSON.

    4. Konfirmasikan bahwa Metode Autentikasi diatur ke String Koneksi. Agar tutorial tetap sederhana, Anda menggunakan autentikasi string koneksi. Dalam skenario produksi, sebaiknya gunakan Azure Managed Identity untuk keamanan yang lebih baik dan manajemen yang lebih mudah. Untuk informasi selengkapnya, lihat Menggunakan identitas terkelola untuk mengakses Azure Event Hubs dari pekerjaan Azure Stream Analytics.

    5. Konfirmasikan bahwa Nama kunci akses bersama Event Hub diatur ke RootManageSharedAccessKey.

    6. Pilih Sambungkan di bagian bawah jendela.

      Cuplikan layar halaman konfigurasi untuk pusat aktivitas Anda.

  9. Dalam beberapa detik, Anda akan melihat contoh data input dan skema. Anda dapat memilih untuk menghilangkan bidang, mengganti nama bidang, atau mengubah tipe data.

    Cuplikan layar memperlihatkan bidang dan pratinjau data.

  10. Pilih petak Azure Data Lake Storage Gen2 di kanvas Anda dan konfigurasikan dengan menentukan

    • Langganan tempat akun Azure Data Lake Gen2 Anda berada

    • Nama akun penyimpanan harus merupakan akun Azure Data Lake Storage Gen2 yang sama yang telah digunakan dengan ruang kerja Azure Synapse Analytics Anda sebagaimana disebutkan di bagian Prasyarat.

    • Kontainer yang digunakan untuk membuat file Parquet.

    • Untuk jalur tabel Delta, tentukan nama untuk tabel.

    • Pola tanggal dan waktu sebagai default yyyy-MM-dd dan HH.

    • Pilih Sambungkan

      Cuplikan layar memperlihatkan pengaturan konfigurasi untuk Data Lake Storage.

  11. Pilih Simpan di pita atas untuk menyimpan pekerjaan Anda, lalu pilih Mulai untuk menjalankan pekerjaan Anda. Setelah pekerjaan dimulai, pilih X di sudut kanan atas untuk menutup halaman Stream Analytics job.

    Cuplikan layar memperlihatkan halaman Mulai Pekerjaan Analitik Stream.

  12. Anda melihat daftar semua pekerjaan Azure Stream Analytics yang dibuat menggunakan editor tanpa kode. Dalam waktu dua menit, pekerjaan Anda masuk ke status Berjalan . Pilih tombol Refresh pada halaman untuk melihat perubahan status dari Dibuat - Mulai ->> Berjalan.

    Cuplikan layar memperlihatkan daftar pekerjaan Azure Stream Analytics.

Melihat output di akun Azure Data Lake Storage Gen 2 Anda

  1. Temukan akun Azure Data Lake Storage Gen2 yang Anda gunakan di langkah sebelumnya.

  2. Pilih Kontainer di bawah bagian Penyimpanan data di menu sebelah kiri.

    Cuplikan layar memperlihatkan pemilihan kontainer di Azure Data Lake Storage Gen 2.

  3. Pilih kontainer yang Anda gunakan di langkah sebelumnya. Anda melihat file parket yang dibuat di folder yang Anda tentukan sebelumnya.

    Cuplikan layar memperlihatkan file parket yang diambil di Azure Data Lake Storage Gen 2.

Melakukan kueri pada data yang diperoleh dalam format Parquet dengan menggunakan Azure Synapse Analytics

Kueri menggunakan Azure Synapse Spark

  1. Temukan ruang kerja Azure Synapse Analytics Anda dan buka Synapse Studio.

  2. Buat kumpulan Apache Spark tanpa server di ruang kerja Anda jika belum ada.

  3. Pilih Buka petak peta Synapse Studio di bagian Memulai untuk meluncurkan Synapse Studio di tab atau jendela baru.

  4. Di Synapse Studio, buka hub Kembangkan dan buat Notebook baru.

    Cuplikan layar memperlihatkan Synapse Studio.

  5. Buat sel kode baru dan tempel kode berikut di sel tersebut: Ganti kontainer dan nama iklan dengan nama kontainer dan akun Azure Data Lake Storage Gen2 yang digunakan pada langkah sebelumnya.

    %%pyspark
    df = spark.read.load('abfss://container@adlsname.dfs.core.windows.net/*/*.parquet', format='parquet')
    display(df.limit(10))
    df.count()
    df.printSchema()
    
  6. Untuk Lampirkan ke pada toolbar, pilih kumpulan Spark Anda dari menu tarik-turun.

  7. Pilih Jalankan Semua untuk melihat hasilnya.

    Cuplikan layar hasil eksekusi spark di Azure Synapse Analytics.

Kueri menggunakan Azure Synapse Serverless SQL

  1. Di hub Kembangkan, buat skrip SQL baru.

    Cuplikan layar memperlihatkan halaman Kembangkan dengan menu skrip SQL baru dipilih.

  2. Tempel skrip berikut dan Jalankan menggunakan Bawaan titik akhir SQL tanpa server. Ganti kontainer dan nama iklan dengan nama kontainer dan akun Azure Data Lake Storage Gen2 yang digunakan pada langkah sebelumnya.

    SELECT
        TOP 100 *
    FROM
        OPENROWSET(
            BULK 'https://adlsname.dfs.core.windows.net/container/*/*.parquet',
            FORMAT='PARQUET'
        ) AS [result]
    

    Cuplikan layar hasil skrip SQL di Azure Synapse Analytics.

Membersihkan sumber daya

  1. Temukan instans Azure Event Hubs Anda dan lihat daftar pekerjaan Azure Stream Analytics di bawah bagian Data Proses . Hentikan semua pekerjaan yang sedang berjalan.
  2. Buka kelompok sumber daya yang Anda gunakan saat menggunakan pembuat acara TollApp.
  3. Pilih Hapus grup sumber daya. Untuk mengonfirmasi penghapusan, ketik nama grup sumber daya.

Langkah berikutnya

Dalam tutorial ini, Anda mempelajari cara membuat pekerjaan Azure Stream Analytics dengan menggunakan editor tanpa kode untuk mengambil aliran data Azure Event Hubs dalam format Parquet. Anda kemudian menggunakan Azure Synapse Analytics untuk mengkueri file Parquet dengan menggunakan Synapse Spark dan Synapse SQL.