Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfada, yönetilen bağlayıcılara kıyasla daha yüksek düzeyde alım işlem hattı özelleştirmesi sunan Databricks Lakeflow Connect'teki standart bağlayıcılar açıklanmaktadır.
ETL yığınının katmanları
Bazı bağlayıcılar ETL yığınının bir düzeyinde çalışır. Örneğin Databricks, Salesforce gibi kurumsal uygulamalar ve SQL Server gibi veritabanları için tam olarak yönetilen bağlayıcılar sunar. Diğer bağlayıcılar ETL yığınının birden çok katmanında çalışır. Örneğin, tam özelleştirme için Yapılandırılmış Akış'ta standart bağlayıcıları veya daha yönetilen bir deneyim için Lakeflow işlem hatlarını kullanabilirsiniz.
Databricks, en yönetilen katmandan başlamanızı önerir. Gereksinimlerinizi karşılamıyorsa (örneğin, veri kaynağınızı desteklemiyorsa), bir sonraki katmana geçin.
Aşağıdaki tabloda, en özelleştirilebilenden en fazla yönetilene kadar sıralanmış olan üç istifleme ürünü katmanı açıklanmaktadır.
| Katman | Açıklama |
|---|---|
| Yapılandırılmış Akış | Apache Spark Yapılandırılmış Akış, Spark API'lerini kullanarak tam bir kez işleme garantileriyle uçtan uca hataya dayanıklılık sunan bir akış altyapısıdır. |
| Lakeflow işlem hatları | Lakeflow işlem hatları Yapılandırılmış Akış'ı genişleterek veri işlem hatları oluşturmaya yönelik bildirim temelli bir çerçeve sunar. Verileriniz üzerinde gerçekleştirilecek dönüştürmeleri tanımlayabilirsiniz ve Lakeflow işlem hatları düzenlemeyi, izlemeyi, veri kalitesini, hataları ve daha fazlasını yönetir. Yapılandırılmış Akıştan daha fazla otomasyon ve daha az ek yük sunar. |
| Yönetilen bağlayıcılar | Tam yönetilen bağlayıcılar, Lakeflow işlem hatları üzerine kuruludur ve en popüler veri kaynakları için daha da fazla otomasyon sunar. Lakeflow işlem hatları işlevselliğini kaynağa özgü kimlik doğrulaması, CDC, uç servis talebi işleme, uzun süreli API bakımı, otomatik yeniden denemeler, otomatik şema evrimi vb. içerecek şekilde genişletir. Bu nedenle, desteklenen tüm veri kaynakları için daha da fazla otomasyon sunar. |
Bir bağlayıcı seçme
Aşağıdaki tabloda veri kaynağına ve işlem hattı özelleştirme düzeyine göre standart alım bağlayıcıları listelenmektedir. Tam otomatik alma deneyimi için bunun yerine yönetilen bağlayıcıları kullanın.
SQL örnekleri, bulut nesne depolamasından artımlı alım için CREATE STREAMING TABLE söz dizimini kullanır. SQL kullanıcılarına ölçeklenebilir ve güçlü bir veri işleme deneyimi sunar, bu yüzden COPY INTO için önerilen alternatif budur.
| Kaynak | Daha fazla özelleştirme | Bazı özelleştirmeler | Daha fazla otomasyon |
|---|---|---|---|
| Bulut nesne depolaması |
Yapılandırılmış Akışlı Otomatik Yükleyici (Python, Scala) |
Lakeflow işlem hatları ile Otomatik Yükleyici (Python, SQL) |
Databricks SQL ile Otomatik Yükleyici (SQL) |
| SFTP sunucuları |
SFTP sunucularından dosya alma (Python, SQL) |
Geçerli Değil | Geçerli Değil |
| Apache Kafka |
Kafka kaynağı ile Yapılandırılmış Akış (Python, Scala) |
Kafka kaynağıyla Lakeflow işlem hatları (Python, SQL) |
Databricks SQL ve Kafka kaynağı (SQL) |
| Google Pub/Sub (Mesajlaşma Hizmeti) |
Pub/Sub kaynağı ile Yapılandırılmış Akış (Python, Scala) |
Pub/Sub kaynaklı Lakeflow işlem hatları (Python, SQL) |
Pub/Sub kaynağıyla Databricks SQL (SQL) |
| Apache Pulsar |
Pulsar kaynağı ile Yapılandırılmış Akış (Python, Scala) |
Pulsar kaynaklı Lakeflow işlem hatları (Python, SQL) |
Pulsar kaynağıyla Databricks SQL (SQL) |
Veri giriş zamanlamaları
Alma işlem hatlarını yinelenen bir zamanlamaya göre veya sürekli çalışacak şekilde yapılandırabilirsiniz.
| Kullanım örneği | Boru hattı modu |
|---|---|
| Toplu alım | Tetiklenen: Yeni verileri bir zamanlamaya göre veya el ile tetiklendiğinde işleme tabi tutar. |
| Akış verisi alma | Sürekli: Yeni verileri kaynağa ulaşırken işler. |