選擇標準連接器

此頁面描述 Databricks Lakeflow Connect 中的標準連接器,相較於受管理的連接器,此連接器提供較高層級的擷取管線自定義。 利用它依資料來源和管線自訂層級選擇標準連接器。

ETL 堆疊的圖層

某些連接器會在 ETL 堆疊的一個層級運作。 例如,Databricks 為 Salesforce 等企業應用程式提供完全受控的連接器,以及 SQL Server 等資料庫。 其他連接器會在 ETL 堆疊的多層運作。 例如,你可以在結構化串流中使用標準連接器來完全自訂,或使用 Lakeflow pipelines 來提供更受管理的體驗。

ETL 堆疊圖表

Databricks 建議從最受控層開始。 如果它不符合您的需求(例如,如果不支援您的數據源),請下拉至下一層。

下表描述三層擷取產品,從最可自定義到最受控的產品排序:

說明
結構化串流 Apache Spark 結構化流式處理是一種串流引擎,提供使用 Spark API 的端對端容錯與精確一次處理保證。
湖流量管線 Lakeflow 管線擴展了結構化串流,提供一個宣告式框架來建立資料管線。 你可以定義要對資料執行的轉換,Lakeflow 管線則管理編排、監控、資料品質、錯誤等多項事務。 它們提供比結構化串流更自動化且負擔更低。
受控連接器 全管理連接器建立在 Lakeflow 管線之上,為最受歡迎的資料來源提供更多自動化功能。 他們擴展 Lakeflow 管線功能,還包括來源特定認證、CDC、邊緣案例處理、長期 API 維護、自動重試、自動化結構演化等功能。 因此,它們為任何支援的數據來源提供更高程度的自動化。

選擇連接器

下表列出數據源和資料管道客製化程度的標準資料擷取連接器。 如需完全自動化的擷取體驗,請改用 受控連接器

從雲端物件記憶體累加擷取的SQL範例使用 CREATE STREAMING TABLE 語法。 它為 SQL 使用者提供可調整且強固的擷取體驗,因此是 的建議替代方案 COPY INTO

來源 更多自定義 某些自定義 更多自動化
雲端物件記憶體 自動載入器與結構化串流
(Python、Scala)
搭載 Lakeflow 管線的自動裝載機
(Python,SQL)
使用 Databricks SQL 自動載入器
(SQL)
SFTP 伺服器 從 SFTP 伺服器擷取檔案
(Python,SQL)
N/A N/A
Apache Kafka 使用 Kafka 來源的結構化串流
(Python、Scala)
含卡夫卡源的湖流量管線
(Python,SQL)
Databricks SQL 與 Kafka 數據源
(SQL)
Google Pub/Sub 服務 使用 Pub/Sub 來源的結構化串流
(Python、Scala)
使用 Pub/Sub 來源的 Lakeflow 管道
(Python,SQL)
具有 Pub/Sub 來源的 Databricks SQL
(SQL)
阿帕奇脈衝星 使用 Pulsar 來源的結構化串流
(Python、Scala)
採用 Pulsar 來源的 Lakeflow 管線
(Python,SQL)
Databricks SQL 與 Pulsar 來源
(SQL)

導入排程

您可以設定匯入管線以定期排程或持續執行。

用例 管線模式
批次匯入 觸發:按排程或手動觸發時,處理新資料。
串流資料引入 連續:在來源送達時處理新數據。