選擇標準連接器

此頁面描述 Databricks Lakeflow Connect 中的標準連接器,相較於受管理的連接器,此連接器提供較高層級的擷取管線自定義。 利用它依資料來源和管線自訂層級選擇標準連接器。

ETL 堆疊的圖層

某些連接器會在 ETL 堆疊的一個層級運作。 例如,Databricks 為 Salesforce 等企業應用程式提供完全受控的連接器,以及 SQL Server 等資料庫。 其他連接器會在 ETL 堆疊的多層運作。 例如,你可以在結構化串流中使用標準連接器來完全自訂,或使用 Lakeflow pipelines 來提供更受管理的體驗。

ETL 堆疊圖表

Databricks 建議從最受控層開始。 如果它不符合您的需求(例如,如果不支援您的數據源),請下拉至下一層。

下表描述三層擷取產品,從最可自定義到最受控的產品排序:

層 說明
結構化串流 Apache Spark 結構化流式處理是一種串流引擎,提供使用 Spark API 的端對端容錯與精確一次處理保證。
湖流量管線 Lakeflow 管線擴展了結構化串流,提供一個宣告式框架來建立資料管線。 你可以定義要對資料執行的轉換,Lakeflow 管線則管理編排、監控、資料品質、錯誤等多項事務。 它們提供比結構化串流更自動化且負擔更低。
受控連接器 全管理連接器建立在 Lakeflow 管線之上,為最受歡迎的資料來源提供更多自動化功能。 他們擴展 Lakeflow 管線功能,還包括來源特定認證、CDC、邊緣案例處理、長期 API 維護、自動重試、自動化結構演化等功能。 因此,它們為任何支援的數據來源提供更高程度的自動化。

選擇連接器

下表列出數據源和資料管道客製化程度的標準資料擷取連接器。 如需完全自動化的擷取體驗,請改用 受控連接器 。

從雲端物件記憶體累加擷取的SQL範例使用 CREATE STREAMING TABLE 語法。 它為 SQL 使用者提供可調整且強固的擷取體驗,因此是 的建議替代方案 COPY INTO。

來源 更多自定義 某些自定義 更多自動化
雲端物件記憶體 自動載入器與結構化串流
(Python、Scala)
搭載 Lakeflow 管線的自動裝載機
(Python,SQL)
使用 Databricks SQL 自動載入器
(SQL)
SFTP 伺服器 從 SFTP 伺服器擷取檔案
(Python,SQL)
N/A N/A
Apache Kafka 使用 Kafka 來源的結構化串流
(Python、Scala)
含卡夫卡源的湖流量管線
(Python,SQL)
Databricks SQL 與 Kafka 數據源
(SQL)
Google Pub/Sub 服務 使用 Pub/Sub 來源的結構化串流
(Python、Scala)
使用 Pub/Sub 來源的 Lakeflow 管道
(Python,SQL)
具有 Pub/Sub 來源的 Databricks SQL
(SQL)
阿帕奇脈衝星 使用 Pulsar 來源的結構化串流
(Python、Scala)
採用 Pulsar 來源的 Lakeflow 管線
(Python,SQL)
Databricks SQL 與 Pulsar 來源
(SQL)

導入排程

您可以設定匯入管線以定期排程或持續執行。

用例 管線模式
批次匯入 觸發:按排程或手動觸發時,處理新資料。
串流資料引入 連續:在來源送達時處理新數據。