Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Quickstart ini menjelaskan cara membuat definisi pekerjaan Spark yang berisi kode Python dengan Spark Structured Streaming untuk menempatkan data di lakehouse dan kemudian menyajikannya melalui endpoint analitik SQL. Setelah menyelesaikan quickstart ini, Anda akan memiliki definisi pekerjaan Spark yang berjalan secara terus-menerus dan endpoint analitik SQL dapat melihat data yang masuk.
Membuat skrip Python
Gunakan skrip Python berikut untuk membuat tabel Delta streaming di lakehouse menggunakan Apache Spark. Skrip membaca aliran data yang dihasilkan (satu baris per detik) dan menulisnya dalam mode tambahkan ke tabel Delta bernama streamingtable. Ini menyimpan data dan informasi titik pemeriksaan di lakehouse yang ditentukan.
Gunakan kode Python berikut yang menggunakan streaming terstruktur Spark untuk mendapatkan data dalam tabel lakehouse.
from pyspark.sql import SparkSession if __name__ == "__main__": # Start Spark session spark = SparkSession.builder \ .appName("RateStreamToDelta") \ .getOrCreate() # Table name used for logging tableName = "streamingtable" # Define Delta Lake storage path deltaTablePath = f"Tables/{tableName}" # Create a streaming DataFrame using the rate source df = spark.readStream \ .format("rate") \ .option("rowsPerSecond", 1) \ .load() # Write the streaming data to Delta query = df.writeStream \ .format("delta") \ .outputMode("append") \ .option("path", deltaTablePath) \ .option("checkpointLocation", f"{deltaTablePath}/_checkpoint") \ .start() # Keep the stream running query.awaitTermination()Simpan skrip Anda sebagai file Python (.py) di komputer lokal Anda.
Membuat lakehouse
Gunakan langkah-langkah berikut untuk membuat rumah tepi danau:
Masuk ke portal Fabric.
Navigasi ke ruang kerja yang Anda inginkan atau buat ruang kerja baru jika diperlukan.
Untuk membuat lakehouse, pilih Item baru dari ruang kerja, lalu pilih Lakehouse di panel yang terbuka.
Masukkan nama lakehouse Anda dan pilih Buat.
Membuat definisi kerja Spark
Gunakan langkah-langkah berikut untuk membuat definisi pekerjaan Spark:
Di ruang kerja yang sama tempat Anda membuat lakehouse, pilih Item Baru.
Di panel yang terbuka, di bawah Dapatkan data, pilih Definisi Pekerjaan Spark.
Masukkan nama definisi pekerjaan Spark Anda dan pilih Buat.
Pilih Unggah dan pilih file Python yang Anda buat di langkah sebelumnya.
Di bawah Referensi Lakehouse, pilih lakehouse yang Anda buat.
Atur kebijakan Retry untuk definisi pekerjaan Spark
Gunakan langkah-langkah berikut untuk mengatur kebijakan coba lagi untuk definisi kerja Spark Anda:
Dari menu atas, pilih ikon Pengaturan .
Buka tab Pengoptimalan dan atur Kebijakan Coba Lagi pemicu Aktif.
Tentukan upaya coba lagi maksimum atau centang Izinkan upaya tak terbatas.
Tentukan waktu antara setiap upaya coba lagi dan pilih Terapkan.
Catatan
Ada batas masa berlaku seumur hidup 90 hari untuk penerapan kebijakan ulang. Setelah kebijakan coba lagi diaktifkan, pekerjaan akan dimulai ulang sesuai dengan kebijakan dalam waktu 90 hari. Setelah periode ini, kebijakan coba lagi akan secara otomatis berhenti berfungsi, dan pekerjaan akan dihentikan. Pengguna kemudian perlu memulai ulang tugas secara manual, yang pada gilirannya, akan mengaktifkan ulang kebijakan coba lagi.
Eksekusi dan pantau definisi pekerjaan Spark
Dari menu atas, pilih ikon Jalankan .
Verifikasi apakah Definisi Job Spark berhasil dikirimkan dan sedang berjalan.
Menampilkan data menggunakan titik akhir analitik SQL
Setelah skrip berjalan, tabel bernama streamingtable dengan tanda waktu dan kolom nilai dibuat di lakehouse. Anda dapat melihat data menggunakan titik akhir analitik SQL:
Dari ruang kerja, buka rumah danau Anda.
Beralih ke titik akhir analitik SQL dari sudut kanan atas.
Dari panel navigasi kiri, perluas Skema > dbo >Tables, pilih streamingtable untuk mempratinjau data.