Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Azure Event Hubs menghasilkan data streaming dalam volume besar yang sering kali perlu Anda simpan untuk analisis. Tutorial ini menunjukkan kepada Anda cara mengambil data tersebut dalam format Parquet - format penyimpanan kolom yang dioptimalkan untuk beban kerja analitik - dengan menggunakan Azure Stream Analytics tanpa menulis kode apa pun.
Gunakan editor tanpa kode Azure Stream Analytics untuk membangun pekerjaan yang mengalirkan data dari Azure Event Hubs langsung ke Azure Data Lake Storage Gen2. Kemudian, kueri file Parquet yang diambil dengan menggunakan Azure Synapse Analytics dengan Spark dan SQL tanpa server.
Dalam tutorial ini, Anda akan mempelajari cara:
- Menyebarkan generator peristiwa yang mengirim peristiwa sampel ke pusat aktivitas
- Buat pekerjaan Stream Analytics dengan menggunakan editor tanpa kode
- Meninjau data input dan skema
- Mengonfigurasi Azure Data Lake Storage Gen2 untuk menangkap data Event Hub
- Jalankan tugas Analisis Aliran
- Menggunakan Azure Synapse Analytics untuk mengkueri file Parquet
Prasyarat
Sebelum memulai, pastikan Anda menyelesaikan langkah-langkah berikut:
- Jika Anda tidak memiliki langganan Azure, buat akun gratis.
-
Sebarkan aplikasi generator peristiwa TollApp ke Azure. Atur
intervalparameter ke 1, dan gunakan grup sumber daya baru untuk langkah ini. - Buat ruang kerja Azure Synapse Analytics dengan akun Data Lake Storage Gen2.
Gunakan editor tanpa kode untuk membuat pekerjaan Analisis Aliran
Temukan grup sumber daya tempat Anda menyebarkan generator peristiwa TollApp.
Pilih namespace Azure Event Hubs. Anda mungkin ingin membukanya di tab terpisah atau jendela.
Pada halaman namespace layanan Azure Event Hubs , pilih Azure Event Hubs di bawah Entitas di menu sebelah kiri.
Pilih
entrystreaminstance.Pada halaman instans Azure Event Hubs , pilih Proses data di bagian Fitur di menu sebelah kiri.
Pilih Mulai pada petak peta Ambil data ke ADLS Gen2 dalam format Parket.
Beri nama pekerjaan
parquetcaptureAnda dan pilih Buat.Pada halaman konfigurasi pusat aktivitas, ikuti langkah-langkah berikut:
Untuk Grup konsumen, pilih Gunakan yang sudah ada.
Konfirmasikan bahwa
$Defaultgrup konsumen dipilih.Konfirmasikan bahwa Serialisasi diatur ke JSON.
Konfirmasikan bahwa Metode Autentikasi diatur ke String Koneksi. Agar tutorial tetap sederhana, Anda menggunakan autentikasi string koneksi. Dalam skenario produksi, sebaiknya gunakan Azure Managed Identity untuk keamanan yang lebih baik dan manajemen yang lebih mudah. Untuk informasi selengkapnya, lihat Menggunakan identitas terkelola untuk mengakses Azure Event Hubs dari pekerjaan Azure Stream Analytics.
Konfirmasikan bahwa Nama kunci akses bersama Event Hub diatur ke RootManageSharedAccessKey.
Pilih Sambungkan di bagian bawah jendela.
Dalam beberapa detik, Anda akan melihat contoh data input dan skema. Anda dapat memilih untuk menghilangkan bidang, mengganti nama bidang, atau mengubah tipe data.
Pilih petak Azure Data Lake Storage Gen2 di kanvas Anda dan konfigurasikan dengan menentukan
Langganan tempat akun Azure Data Lake Gen2 Anda berada
Nama akun penyimpanan harus merupakan akun Azure Data Lake Storage Gen2 yang sama yang telah digunakan dengan ruang kerja Azure Synapse Analytics Anda sebagaimana disebutkan di bagian Prasyarat.
Kontainer yang digunakan untuk membuat file Parquet.
Untuk jalur tabel Delta, tentukan nama untuk tabel.
Pola tanggal dan waktu sebagai default
yyyy-MM-dddanHH.Pilih Sambungkan
Pilih Simpan di pita atas untuk menyimpan pekerjaan Anda, lalu pilih Mulai untuk menjalankan pekerjaan Anda. Setelah pekerjaan dimulai, pilih X di sudut kanan atas untuk menutup halaman Stream Analytics job.
Anda melihat daftar semua pekerjaan Azure Stream Analytics yang dibuat menggunakan editor tanpa kode. Dalam waktu dua menit, pekerjaan Anda masuk ke status Berjalan . Pilih tombol Refresh pada halaman untuk melihat perubahan status dari Dibuat - Mulai ->> Berjalan.
Melihat output di akun Azure Data Lake Storage Gen 2 Anda
Temukan akun Azure Data Lake Storage Gen2 yang Anda gunakan di langkah sebelumnya.
Pilih Kontainer di bawah bagian Penyimpanan data di menu sebelah kiri.
Pilih kontainer yang Anda gunakan di langkah sebelumnya. Anda melihat file parket yang dibuat di folder yang Anda tentukan sebelumnya.
Melakukan kueri pada data yang diperoleh dalam format Parquet dengan menggunakan Azure Synapse Analytics
Kueri menggunakan Azure Synapse Spark
Temukan ruang kerja Azure Synapse Analytics Anda dan buka Synapse Studio.
Buat kumpulan Apache Spark tanpa server di ruang kerja Anda jika belum ada.
Pilih Buka petak peta Synapse Studio di bagian Memulai untuk meluncurkan Synapse Studio di tab atau jendela baru.
Di Synapse Studio, buka hub Kembangkan dan buat Notebook baru.
Buat sel kode baru dan tempel kode berikut di sel tersebut: Ganti kontainer dan nama iklan dengan nama kontainer dan akun Azure Data Lake Storage Gen2 yang digunakan pada langkah sebelumnya.
%%pyspark df = spark.read.load('abfss://container@adlsname.dfs.core.windows.net/*/*.parquet', format='parquet') display(df.limit(10)) df.count() df.printSchema()Untuk Lampirkan ke pada toolbar, pilih kumpulan Spark Anda dari menu tarik-turun.
Pilih Jalankan Semua untuk melihat hasilnya.
Kueri menggunakan Azure Synapse Serverless SQL
Di hub Kembangkan, buat skrip SQL baru.
Tempel skrip berikut dan Jalankan menggunakan Bawaan titik akhir SQL tanpa server. Ganti kontainer dan nama iklan dengan nama kontainer dan akun Azure Data Lake Storage Gen2 yang digunakan pada langkah sebelumnya.
SELECT TOP 100 * FROM OPENROWSET( BULK 'https://adlsname.dfs.core.windows.net/container/*/*.parquet', FORMAT='PARQUET' ) AS [result]
Membersihkan sumber daya
- Temukan instans Azure Event Hubs Anda dan lihat daftar pekerjaan Azure Stream Analytics di bawah bagian Data Proses . Hentikan semua pekerjaan yang sedang berjalan.
- Buka kelompok sumber daya yang Anda gunakan saat menggunakan pembuat acara TollApp.
- Pilih Hapus grup sumber daya. Untuk mengonfirmasi penghapusan, ketik nama grup sumber daya.
Langkah berikutnya
Dalam tutorial ini, Anda mempelajari cara membuat pekerjaan Azure Stream Analytics dengan menggunakan editor tanpa kode untuk mengambil aliran data Azure Event Hubs dalam format Parquet. Anda kemudian menggunakan Azure Synapse Analytics untuk mengkueri file Parquet dengan menggunakan Synapse Spark dan Synapse SQL.