此頁面描述 Databricks Lakeflow Connect 中的標準連接器,相較於受管理的連接器,此連接器提供較高層級的擷取管線自定義。 利用它依資料來源和管線自訂層級選擇標準連接器。
ETL 堆疊的圖層
某些連接器會在 ETL 堆疊的一個層級運作。 例如,Databricks 為 Salesforce 等企業應用程式提供完全受控的連接器,以及 SQL Server 等資料庫。 其他連接器會在 ETL 堆疊的多層運作。 例如,你可以在結構化串流中使用標準連接器來完全自訂,或使用 Lakeflow pipelines 來提供更受管理的體驗。
Databricks 建議從最受控層開始。 如果它不符合您的需求(例如,如果不支援您的數據源),請下拉至下一層。
下表描述三層擷取產品,從最可自定義到最受控的產品排序:
| 層 | 說明 |
|---|---|
| 結構化串流 | Apache Spark 結構化流式處理是一種串流引擎,提供使用 Spark API 的端對端容錯與精確一次處理保證。 |
| 湖流量管線 | Lakeflow 管線擴展了結構化串流,提供一個宣告式框架來建立資料管線。 你可以定義要對資料執行的轉換,Lakeflow 管線則管理編排、監控、資料品質、錯誤等多項事務。 它們提供比結構化串流更自動化且負擔更低。 |
| 受控連接器 | 全管理連接器建立在 Lakeflow 管線之上,為最受歡迎的資料來源提供更多自動化功能。 他們擴展 Lakeflow 管線功能,還包括來源特定認證、CDC、邊緣案例處理、長期 API 維護、自動重試、自動化結構演化等功能。 因此,它們為任何支援的數據來源提供更高程度的自動化。 |
選擇連接器
下表列出數據源和資料管道客製化程度的標準資料擷取連接器。 如需完全自動化的擷取體驗,請改用 受控連接器 。
從雲端物件記憶體累加擷取的SQL範例使用 CREATE STREAMING TABLE 語法。 它為 SQL 使用者提供可調整且強固的擷取體驗,因此是 的建議替代方案 COPY INTO。
| 來源 | 更多自定義 | 某些自定義 | 更多自動化 |
|---|---|---|---|
| 雲端物件記憶體 |
自動載入器與結構化串流 (Python、Scala) |
搭載 Lakeflow 管線的自動裝載機 (Python,SQL) |
使用 Databricks SQL 自動載入器 (SQL) |
| SFTP 伺服器 |
從 SFTP 伺服器擷取檔案 (Python,SQL) |
N/A | N/A |
| Apache Kafka |
使用 Kafka 來源的結構化串流 (Python、Scala) |
含卡夫卡源的湖流量管線 (Python,SQL) |
Databricks SQL 與 Kafka 數據源 (SQL) |
| Google Pub/Sub 服務 |
使用 Pub/Sub 來源的結構化串流 (Python、Scala) |
使用 Pub/Sub 來源的 Lakeflow 管道 (Python,SQL) |
具有 Pub/Sub 來源的 Databricks SQL (SQL) |
| 阿帕奇脈衝星 |
使用 Pulsar 來源的結構化串流 (Python、Scala) |
採用 Pulsar 來源的 Lakeflow 管線 (Python,SQL) |
Databricks SQL 與 Pulsar 來源 (SQL) |
導入排程
您可以設定匯入管線以定期排程或持續執行。
| 用例 | 管線模式 |
|---|---|
| 批次匯入 | 觸發:按排程或手動觸發時,處理新資料。 |
| 串流資料引入 | 連續:在來源送達時處理新數據。 |