Spark 宣告式管線

Apache Spark™ 宣告式管線是一個宣告式框架,用於使用 SQL 和 Python 建構批次與串流資料管線。 Lakeflow 管線可延伸並與 Spark 宣告式管線互通,同時運行於效能最佳化的 Databricks 執行環境。 管道的常見使用案例包括從雲端儲存 (例如 Amazon S3、Azure ADLS Gen2 和 Google Cloud Storage) 和訊息匯流排 (例如 Apache Kafka、Amazon Kinesis、Google Pub/Sub、Azure EventHub 和 Apache Pulsar) 等來源擷取資料,以及增量批次和串流轉換。

備註

湖流量管線需要購買 高級方案。 如需詳細資訊,請連絡您的 Databricks 客戶小組。

本節提供有關使用管線的詳細資訊。 以下主題將幫助你開始。

主題 Description
管線概念 了解管線的高階概念,包括流程、串流表與具體化視圖。
教學課程 請遵循教學課程,為您提供使用管線的實作經驗。
開發管線 瞭解如何開發和測試管線,以建立用於擷取和轉換資料的流程。
配置管道 瞭解如何排程和設定管線。
監視管線 瞭解如何監視管線,並針對管線查詢進行疑難排解。
開發人員 瞭解如何在開發管線時使用 Python 和 SQL。
獨立管線 學習如何在 Databricks SQL 或 Python 中建立獨立串流資料表和實體化視圖。
最佳作法 學習建立可靠、高效且易於維護的管線推薦模式。

其他資源