หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
การเริ่มต้นอย่างรวดเร็วนี้อธิบายวิธีสร้างนิยามงาน Spark ที่มีโค้ด Python ด้วย Spark Structured Streaming เพื่อให้ข้อมูลถูกส่งไปยังบ้านพักริมทะเลสาบและส่งผ่าน SQL analytics endpoint หลังจากเริ่มต้นอย่างรวดเร็วนี้เสร็จ คุณจะมีการกําหนดงาน Spark ที่ทํางานอย่างต่อเนื่อง และ SQL analytics endpoint จะสามารถดูข้อมูลที่เข้ามาได้
สร้างสคริปต์ Python
ใช้สคริปต์ Python ต่อไปนี้เพื่อสร้างตาราง Delta การสตรีมในเลคเฮ้าส์โดยใช้ Apache Spark สคริปต์จะอ่านสตรีมของข้อมูลที่สร้างขึ้น (หนึ่งแถวต่อวินาที) และเขียนในโหมดผนวกไปยังตาราง Delta ที่ชื่อว่าstreamingtable ซึ่งจัดเก็บข้อมูลและจุดตรวจสอบในเลคเฮ้าส์ที่ระบุ
ใช้รหัส Python ต่อไปนี้ที่ใช้ Spark ที่มีโครงสร้างการสตรีมเพื่อรับข้อมูลในตารางเลคเฮ้าส์
from pyspark.sql import SparkSession if __name__ == "__main__": # Start Spark session spark = SparkSession.builder \ .appName("RateStreamToDelta") \ .getOrCreate() # Table name used for logging tableName = "streamingtable" # Define Delta Lake storage path deltaTablePath = f"Tables/{tableName}" # Create a streaming DataFrame using the rate source df = spark.readStream \ .format("rate") \ .option("rowsPerSecond", 1) \ .load() # Write the streaming data to Delta query = df.writeStream \ .format("delta") \ .outputMode("append") \ .option("path", deltaTablePath) \ .option("checkpointLocation", f"{deltaTablePath}/_checkpoint") \ .start() # Keep the stream running query.awaitTermination()บันทึกสคริปต์ของคุณเป็นไฟล์ Python (.py) ภายในเครื่องคอมพิวเตอร์ของคุณ
สร้างเลคเฮ้าส์
ใช้ขั้นตอนต่อไปนี้เพื่อสร้างเลคเฮาส์:
ลงชื่อเข้าใช้พอร์ทัล Fabric
นําทางไปยังพื้นที่ทํางานที่คุณต้องการหรือสร้างใหม่ถ้าจําเป็น
เมื่อต้องการสร้างเลคเฮาส์ ให้เลือก รายการใหม่ จากพื้นที่ทํางาน จากนั้นเลือก เลคเฮาส์ ในแผงที่เปิดขึ้น
ป้อนชื่อเลคเฮาส์ของคุณแล้วเลือกสร้าง
สร้างข้อกําหนดงาน Spark
ใช้ขั้นตอนต่อไปนี้เพื่อสร้างนิยามงาน Spark:
จากพื้นที่ทํางานเดียวกันกับที่คุณสร้างเลคเฮาส์ ให้เลือก รายการใหม่
ในแผงที่เปิดขึ้น ภายใต้ รับข้อมูล ให้เลือก ข้อกําหนดงาน Spark
ป้อนชื่อคํานิยามงาน Spark ของคุณแล้วเลือก สร้าง
เลือก อัปโหลด และเลือกไฟล์ Python ที่คุณสร้างขึ้นในขั้นตอนก่อนหน้า
ภายใต้ การอ้างอิงเลคเฮาส์ ให้เลือกเลคเฮาส์ที่คุณสร้างขึ้น
ตั้งค่านโยบาย Retry สําหรับการกําหนดงาน Spark
ใช้ขั้นตอนต่อไปนี้เพื่อตั้งค่านโยบายการลองใหม่สําหรับข้อกําหนดงาน Spark ของคุณ:
จากเมนูด้านบน ให้เลือกไอคอนการตั้งค่า
เปิดแท็บ การเพิ่มประสิทธิภาพ และตั้งค่า เปิดนโยบายลองใหม่
กําหนดความพยายามสูงสุดอีกครั้งหรือเลือก อนุญาตให้พยายามไม่จํากัด
ระบุเวลาระหว่างการลองอีกครั้งแต่ละครั้ง แล้วเลือกใช้
Note
มีขีดจํากัดตลอดอายุการใช้งาน 90 วันสําหรับการตั้งค่านโยบายลองใหม่ เมื่อเปิดใช้งานนโยบายการลองใหม่ งานจะถูกรีสตาร์ตตามนโยบายภายใน 90 วัน หลังจากช่วงเวลานี้ นโยบายการลองใหม่จะหยุดทํางานโดยอัตโนมัติและงานจะถูกยุติลง จากนั้นผู้ใช้จะต้องรีสตาร์ทงานด้วยตนเองซึ่งจะเปิดใช้งานนโยบายลองใหม่อีกครั้ง
ดําเนินการและตรวจสอบการกําหนดงาน Spark
จากเมนูด้านบน ให้เลือกไอคอนเรียกใช้
ตรวจสอบว่า มีการส่งข้อกําหนด งาน Spark สําเร็จและเรียกใช้งานหรือไม่
ดูข้อมูลโดยใช้จุดสิ้นสุดการวิเคราะห์ SQL
หลังจากสคริปต์ทํางาน ตารางชื่อ streamingtable ที่มีการ ประทับเวลา และคอลัมน์ ค่า จะถูกสร้างขึ้นในเลคเฮาส์ คุณสามารถดูข้อมูลโดยใช้จุดสิ้นสุดการวิเคราะห์ SQL:
จากพื้นที่ทํางาน เปิดบ้านริมทะเลสาบของคุณ
สลับไปยัง จุดสิ้นสุดการวิเคราะห์ SQL จากมุมบนขวา
จากบานหน้าต่างนําทางด้านซ้าย ขยาย Schemas > dbo >Table เลือก streamingtable เพื่อแสดงตัวอย่างข้อมูล