Memasukkan data streaming ke lakehouse dan mengakses melalui titik akhir analitik SQL

Quickstart ini menjelaskan cara membuat definisi pekerjaan Spark yang berisi kode Python dengan Spark Structured Streaming untuk menempatkan data di lakehouse dan kemudian menyajikannya melalui endpoint analitik SQL. Setelah menyelesaikan quickstart ini, Anda akan memiliki definisi pekerjaan Spark yang berjalan secara terus-menerus dan endpoint analitik SQL dapat melihat data yang masuk.

Membuat skrip Python

Gunakan skrip Python berikut untuk membuat tabel Delta streaming di lakehouse menggunakan Apache Spark. Skrip membaca aliran data yang dihasilkan (satu baris per detik) dan menulisnya dalam mode tambahkan ke tabel Delta bernama streamingtable. Ini menyimpan data dan informasi titik pemeriksaan di lakehouse yang ditentukan.

  1. Gunakan kode Python berikut yang menggunakan streaming terstruktur Spark untuk mendapatkan data dalam tabel lakehouse.

    from pyspark.sql import SparkSession
    
    if __name__ == "__main__":
     # Start Spark session
     spark = SparkSession.builder \
         .appName("RateStreamToDelta") \
         .getOrCreate()
    
     # Table name used for logging
     tableName = "streamingtable"
    
     # Define Delta Lake storage path
     deltaTablePath = f"Tables/{tableName}"
    
     # Create a streaming DataFrame using the rate source
     df = spark.readStream \
         .format("rate") \
         .option("rowsPerSecond", 1) \
         .load()
    
     # Write the streaming data to Delta
     query = df.writeStream \
         .format("delta") \
         .outputMode("append") \
         .option("path", deltaTablePath) \
         .option("checkpointLocation", f"{deltaTablePath}/_checkpoint") \
         .start()
    
     # Keep the stream running
     query.awaitTermination()
    
  2. Simpan skrip Anda sebagai file Python (.py) di komputer lokal Anda.

Membuat lakehouse

Gunakan langkah-langkah berikut untuk membuat rumah tepi danau:

  1. Masuk ke portal Fabric.

  2. Navigasi ke ruang kerja yang Anda inginkan atau buat ruang kerja baru jika diperlukan.

  3. Untuk membuat lakehouse, pilih Item baru dari ruang kerja, lalu pilih Lakehouse di panel yang terbuka.

    Cuplikan layar memperlihatkan dialog lakehouse baru.

  4. Masukkan nama lakehouse Anda dan pilih Buat.

Membuat definisi kerja Spark

Gunakan langkah-langkah berikut untuk membuat definisi pekerjaan Spark:

  1. Di ruang kerja yang sama tempat Anda membuat lakehouse, pilih Item Baru.

  2. Di panel yang terbuka, di bawah Dapatkan data, pilih Definisi Pekerjaan Spark.

  3. Masukkan nama definisi pekerjaan Spark Anda dan pilih Buat.

  4. Pilih Unggah dan pilih file Python yang Anda buat di langkah sebelumnya.

  5. Di bawah Referensi Lakehouse, pilih lakehouse yang Anda buat.

Atur kebijakan Retry untuk definisi pekerjaan Spark

Gunakan langkah-langkah berikut untuk mengatur kebijakan coba lagi untuk definisi kerja Spark Anda:

  1. Dari menu atas, pilih ikon Pengaturan .

    Cuplikan layar memperlihatkan ikon pengaturan Definisi Pekerjaan Spark.

  2. Buka tab Pengoptimalan dan atur Kebijakan Coba Lagi pemicu Aktif.

    Cuplikan layar memperlihatkan tab pengoptimalan Definisi Pekerjaan Spark.

  3. Tentukan upaya coba lagi maksimum atau centang Izinkan upaya tak terbatas.

  4. Tentukan waktu antara setiap upaya coba lagi dan pilih Terapkan.

Catatan

Ada batas masa berlaku seumur hidup 90 hari untuk penerapan kebijakan ulang. Setelah kebijakan coba lagi diaktifkan, pekerjaan akan dimulai ulang sesuai dengan kebijakan dalam waktu 90 hari. Setelah periode ini, kebijakan coba lagi akan secara otomatis berhenti berfungsi, dan pekerjaan akan dihentikan. Pengguna kemudian perlu memulai ulang tugas secara manual, yang pada gilirannya, akan mengaktifkan ulang kebijakan coba lagi.

Eksekusi dan pantau definisi pekerjaan Spark

  1. Dari menu atas, pilih ikon Jalankan .

    Cuplikan layar memperlihatkan ikon eksekusi Definisi Pekerjaan Spark.

  2. Verifikasi apakah Definisi Job Spark berhasil dikirimkan dan sedang berjalan.

Menampilkan data menggunakan titik akhir analitik SQL

Setelah skrip berjalan, tabel bernama streamingtable dengan tanda waktu dan kolom nilai dibuat di lakehouse. Anda dapat melihat data menggunakan titik akhir analitik SQL:

  1. Dari ruang kerja, buka rumah danau Anda.

  2. Beralih ke titik akhir analitik SQL dari sudut kanan atas.

  3. Dari panel navigasi kiri, perluas Skema > dbo >Tables, pilih streamingtable untuk mempratinjau data.