Łączniki standardowe w programie Lakeflow Connect

Na tej stronie opisano standardowe konektory w usłudze Databricks Lakeflow Connect, które oferują wyższe poziomy dostosowywania procesu pobierania danych w porównaniu z zarządzanymi konektorami.

Warstwy stosu ETL

Niektóre łączniki działają na jednym poziomie stosu ETL. Na przykład usługa Databricks oferuje w pełni zarządzane łączniki dla aplikacji dla przedsiębiorstw, takich jak Salesforce i bazy danych, takie jak SQL Server. Inne łączniki działają w wielu warstwach stosu ETL. Na przykład można użyć standardowych konektorów zarówno w Structured Streaming, aby uzyskać pełną elastyczność dostosowania, jak i potoków Lakeflow, aby korzystać z bardziej zarządzanego rozwiązania.

Diagram stosu ETL

Usługa Databricks zaleca rozpoczęcie od najbardziej zarządzanej warstwy. Jeśli nie spełnia Twoich wymagań (na przykład, jeśli nie obsługuje Twojego źródła danych), przejdź do następnej warstwy.

W poniższej tabeli opisano trzy warstwy produktów integracji, uporządkowane od najbardziej dostosowywalnych do najbardziej zarządzanych.

Warstwa Opis
Przesyłanie strumieniowe ze strukturą Strukturalne Przesyłanie Strumieniowe Apache Spark to silnik przesyłania strumieniowego, który oferuje kompleksową odporność na uszkodzenia oraz gwarantowane dokładnie jednokrotne przetwarzanie przy użyciu interfejsów API Spark.
Potoki Lakeflow Lakeflow Pipelines rozszerza Structured Streaming, oferując deklaratywne środowisko do tworzenia potoków danych. Możesz zdefiniować przekształcenia wykonywane na danych, a potoki Lakeflow zarządzają orkiestracją, monitorowaniem, jakością danych, błędami i nie tylko. Oferują one większą automatyzację i mniejsze obciążenie niż przesyłanie strumieniowe ze strukturą.
Łączniki zarządzane W pełni zarządzane łączniki opierają się na potokach Lakeflow, zapewniając jeszcze wyższy poziom automatyzacji dla najpopularniejszych źródeł danych. Rozszerzają one funkcjonalność potoków Lakeflow o uwierzytelnianie specyficzne dla źródła, obsługę CDC, obsługę sytuacji wyjątkowych, długoterminowe utrzymanie interfejsu API, automatyczne ponawianie prób, automatyczną ewolucję schematu itd. W związku z tym oferują jeszcze większą automatyzację dla wszystkich obsługiwanych źródeł danych.

Wybieranie łącznika

W poniższej tabeli wymieniono standardowe łączniki przyjmowania według źródła danych i poziomu personalizacji potoku danych. Dla w pełni zautomatyzowanego procesu pozyskiwania danych używaj zarządzanych łączników.

Przykłady sql dotyczące przyrostowego pozyskiwania z magazynu obiektów w chmurze używają CREATE STREAMING TABLE składni. Oferuje użytkownikom SQL skalowalne i niezawodne doświadczenie pozyskiwania danych, dlatego jest zalecaną alternatywą dla programu COPY INTO.

Źródło Więcej dostosowywania Niektóre dostosowania Więcej automatyzacji
Magazyn obiektów w chmurze Automatyczne ładowanie za pomocą przesyłania strumieniowego ze strukturą
(Python, Scala)
Automatyczne ładowanie przy użyciu potoków lakeflow
(Python, SQL)
Automatyczne ładowanie przy użyciu usługi Databricks SQL
(SQL)
Serwery SFTP Pozyskiwanie plików z serwerów SFTP
(Python, SQL)
N/A N/A
Apache Kafka Przesyłanie strumieniowe ze strukturą za pomocą źródła platformy Kafka
(Python, Scala)
Potoki Lakeflow ze źródłem Kafka
(Python, SQL)
Usługa Databricks SQL ze źródłem platformy Kafka
(SQL)
Google Pub/Sub (usługa przesyłania wiadomości) Strumieniowanie ustrukturyzowane z wykorzystaniem źródła Pub/Sub
(Python, Scala)
Potoki Lakeflow ze źródłem Pub/Sub
(Python, SQL)
Usługa Databricks SQL ze źródłem Pub/Sub
(SQL)
Apache Pulsar Strukturalne przesyłanie strumieniowe z źródłem Pulsar
(Python, Scala)
Potoki Lakeflow ze źródłem Pulsar
(Python, SQL)
Usługa Databricks SQL ze źródłem Pulsar
(SQL)

harmonogramy przyjmowania

Potoki przetwarzania danych można skonfigurować tak, aby działały według harmonogramu okresowego lub stale.

Przypadek użycia Tryb potokowy
Pozyskiwanie wsadowe Wyzwalane: przetwarza nowe dane zgodnie z harmonogramem lub po ręcznym wyzwoleniu.
Strumieniowe pobieranie danych Ciągły: przetwarza nowe dane w miarę ich nadejścia w źródle.