Apache Spark™ 宣告式管線是一個宣告式框架,用於使用 SQL 和 Python 建構批次與串流資料管線。 Lakeflow 管線可延伸並與 Spark 宣告式管線互通,同時運行於效能最佳化的 Databricks 執行環境。 管道的常見使用案例包括從雲端儲存 (例如 Amazon S3、Azure ADLS Gen2 和 Google Cloud Storage) 和訊息匯流排 (例如 Apache Kafka、Amazon Kinesis、Google Pub/Sub、Azure EventHub 和 Apache Pulsar) 等來源擷取資料,以及增量批次和串流轉換。
備註
湖流量管線需要購買 高級方案。 如需詳細資訊,請連絡您的 Databricks 客戶小組。
本節提供有關使用管線的詳細資訊。 以下主題將幫助你開始。
| 主題 | Description |
|---|---|
| 管線概念 | 了解管線的高階概念,包括流程、串流表與具體化視圖。 |
| 教學課程 | 請遵循教學課程,為您提供使用管線的實作經驗。 |
| 開發管線 | 瞭解如何開發和測試管線,以建立用於擷取和轉換資料的流程。 |
| 配置管道 | 瞭解如何排程和設定管線。 |
| 監視管線 | 瞭解如何監視管線,並針對管線查詢進行疑難排解。 |
| 開發人員 | 瞭解如何在開發管線時使用 Python 和 SQL。 |
| 獨立管線 | 學習如何在 Databricks SQL 或 Python 中建立獨立串流資料表和實體化視圖。 |
| 最佳作法 | 學習建立可靠、高效且易於維護的管線推薦模式。 |