Dış veritabanlarına ve kataloglara bağlanma

Azure Databricks, verilerinizi geçirmeden dış veritabanlarındaki ve kataloglardaki verileri sorgulamak ve bunlara erişmek için birden çok seçenek sağlar. Erişim deseninize, idare gereksinimlerinize, yazma gereksinimlerinize ve işlem tercihlerinize göre yaklaşımı seçin.

Bir yaklaşım seçin

Aşağıdaki tablo, doğru yaklaşımı seçmenize yardımcı olmak için sorgu federasyonu ile katalog federasyonunu karşılaştırmaktadır.

Description Sorgu çalıştırma Destek yazın Governance En iyi kullanım alanları
Sorgu Birleşimi JDBC kullanarak harici ilişkisel veritabanlarında federatif sorgular çalıştırın; sorguların otomatik olarak dış veritabanına iletilmesinden ve harici kataloglar üzerinden Unity Catalog yönetişiminden yararlanın. JDBC kullanılarak dış veritabanına aktarıldı. Sorgu hem Azure Databricks hem de uzak işlem üzerinde çalışır. Desteklenmiyor (salt okunur). Tablo düzeyinde erişim denetimlerine sahip Unity Kataloğu harici kataloğu. İşletimsel veritabanlarına özel raporlama, BI ve kavram kanıtlama amaçlı erişim.
Katalog birleştirme Dış katalog platformlarını (Hive Meta Veri Deposu, AWS Glue veya Snowflake gibi) bağlayarak verilerini doğrudan nesne depolama alanında sorgulayabilirsiniz. Yalnızca Azure Databricks işlem kümesinde, nesne depolama üzerinde doğrudan çalışır. Sorgu federasyonundan daha uygun maliyetli ve performans açısından iyileştirilmiş. Desteklenmiyor (salt okunur). Tablo düzeyinde erişim denetimlerine sahip Unity Kataloğu harici kataloğu. Unity Kataloğu'na kademeli geçiş yapmak veya verilerin dış bir katalogda bulunduğu uzun vadeli bir hibrit modeli sürdürmek.

Lakehouse Federasyonu

Lakehouse Federation, Azure Databricks sorgu federasyon platformudur. Unity Kataloğu yabancı katalogları aracılığıyla dış verilere yönetilen, salt okunur erişim sağlar ve tablo düzeyinde otomatik sorgu gönderimi ve ayrıntılı erişim denetimleri sağlar.

İki tür Lakehouse Federasyonu vardır: sorgu federasyonu ve katalog federasyonu.

Sorgu federasyonu ile katalog federasyonu karşılaştırması

Aşağıdaki tabloda sorgu federasyonu ile katalog federasyonu arasındaki temel farklar açıklanmaktadır.

Sorgu yolu Kullanım örneği Adımlara genel bakış
Sorgu Birleşimi Unity Kataloğu sorguları JDBC kullanılarak yabancı veritabanına gönderiliyor. Sorgu hem Azure Databricks hem de uzak işlem kullanılarak çalıştırılır.
  • Dış veritabanlarında depolanan işletimsel verilere geçici raporlama veya kavram kanıtı erişimine ihtiyacınız vardır.
  • Veri taşımayı en aza indirmek ve dış sistemlere canlı erişimi sürdürmek istiyorsunuz.

Kaynağınız hem Lakehouse Federasyonu hem de Lakeflow Connect'i desteklediğinde, Azure Databricks daha yüksek veri hacimlerinde performans ve daha düşük gecikme süresi öncelikleri varsa Lakeflow Connect'i önerir.
  • Erişim kimlik bilgileriniz ve JDBC URL'nizle Unity Kataloğu'nda bir bağlantı oluşturun.
  • Bağlantıyı kullanarak bir yabancı katalog oluşturun.
  • Yabancı katalogdaki tablolardaki kullanıcılara ayrıcalıklar verin.
  • Sorguları çalıştırın. Bunlar dış veritabanına iletilir.
Katalog birleştirme Unity Kataloğu sorguları, nesne depolamadaki yabancı tabloya doğrudan erişer. Katalog federasyonu, katalog ve depolama hizmetlerine doğrudan erişimi destekleyen platformlar için kullanılabilir. Sorgu yalnızca Azure Databricks işlem üzerinde çalıştırılır; bu da katalog federasyonunun sorgu federasyonundan daha uygun maliyetli ve performans açısından iyileştirilmiş olduğu anlamına gelir.
  • Unity Kataloğu'na geçiyorsunuz, ancak harici bir katalogdan yönetilen verileri kademeli olarak devreye almanız gerekiyor.
  • Bazı verilerin dış katalogda kaldığı ve bazı verilerin Unity Kataloğu tarafından yönetildiği uzun vadeli bir karma model istiyorsunuz.
  • Dış kataloğa erişmek için Unity Kataloğu'nda bir bağlantı oluşturun.
  • Tablo yolları için bir depolama kimlik bilgisi ve bir harici konum oluşturun.
  • Bağlantıyı ve dış konumu kullanarak bir yabancı katalog oluşturun.
  • Yabancı katalogdaki tablolardaki kullanıcılara ayrıcalıklar verin.
  • Sorguları çalıştırın. Bunlar doğrudan nesne depolama üzerinde çalışır.

Desteklenen veri kaynakları

Sorgu federasyonu kullanarak aşağıdaki kaynaklara bağlanın:

Katalog federasyonunu kullanarak aşağıdaki kaynaklara bağlanın:

Spark veri kaynakları

Spark Veri Kaynağı API'si, dış veritabanlarından doğrudan Azure Databricks okumanızı ve bu veritabanlarına yazmanızı sağlar. Lakehouse Federation kaynağınızı desteklemediğinde, yazma erişimine ihtiyacınız olduğunda veya sorgu yürütme ve paralelleştirme üzerinde daha fazla denetime ihtiyacınız olduğunda bunu kullanın.

Databricks Runtime, PostgreSQL, SQL Server, MySQL, Snowflake ve Redshift gibi yaygın veritabanları için paketlenmiş bağlayıcılar içerir. JDBC uyumlu herhangi bir veritabanı için, merkezi kimlik bilgileri yönetimiyle kendi sürücünüzü getirmek için bir JDBC Unity Kataloğu bağlantısı kullanabilirsiniz. Ayrıca, PySpark DataSource API'sini kullanarak ayrılmış kümelere üçüncü taraf bağlayıcılar yükleyebilir veya Python'de tam özel bağlayıcılar oluşturabilirsiniz.

Kurulum yönergeleri ve tüm ayrıntılar için bkz. Spark veri kaynakları.

Ek kaynaklar