Menyambungkan ke database dan katalog eksternal

Azure Databricks menyediakan beberapa opsi untuk mengkueri dan mengakses data dalam database dan katalog eksternal tanpa memigrasikan data Anda. Pilih pendekatan berdasarkan pola akses, persyaratan tata kelola, kebutuhan tulis, dan preferensi komputasi Anda.

Pilih pendekatan

Tabel berikut membandingkan federasi kueri dan federasi katalog untuk membantu Anda memilih pendekatan yang tepat.

Approach Deskripsi Pelaksanaan kueri Menulis dukungan Governance Paling cocok untuk
Federasi kueri Jalankan kueri terfederasi pada basis data relasional eksternal menggunakan JDBC, dengan pendorongan kueri otomatis dan tata kelola Unity Catalog melalui katalog eksternal. Didorong ke database eksternal menggunakan JDBC. Kueri dijalankan baik pada Azure Databricks maupun komputasi jarak jauh. Tidak didukung (baca-saja). Katalog asing Unity Catalog dengan kontrol akses tingkat tabel. Pelaporan ad hoc, BI, dan akses bukti konsep ke database operasional.
Federasi katalog Sambungkan platform katalog eksternal (seperti Apache Hive Metastore, AWS Glue, atau Snowflake) sehingga Anda dapat mengkueri datanya langsung di penyimpanan objek. Berjalan langsung terhadap penyimpanan objek pada komputasi Azure Databricks saja. Lebih hemat biaya dan dioptimalkan untuk performa daripada federasi kueri. Tidak didukung (baca-saja). Katalog asing Unity Catalog dengan kontrol akses tingkat tabel. Bermigrasi ke Unity Catalog secara bertahap, atau mempertahankan model hibrid jangka panjang dengan data dalam katalog eksternal.

Federasi Lakehouse

Lakehouse Federation adalah platform federasi kueri Azure Databricks. Ini menyediakan akses baca-saja yang terkelola ke data eksternal melalui foreign catalog Unity Catalog, dengan pushdown kueri otomatis dan kontrol akses terperinci di tingkat tabel.

Ada dua jenis Federasi Lakehouse: federasi kueri dan federasi katalog.

Federasi kueri dibandingkan dengan federasi katalog

Tabel berikut ini menjelaskan perbedaan utama antara federasi kueri dan federasi katalog.

Approach Jalur kueri Skenario penggunaan Gambaran umum langkah-langkah
Federasi kueri Kueri Katalog Unity dikirimkan ke database asing menggunakan JDBC. Kueri dijalankan baik di Azure Databricks maupun menggunakan komputasi jarak jauh.
  • Anda memerlukan pelaporan ad hoc atau akses bukti konsep ke data operasional yang disimpan dalam database eksternal.
  • Anda ingin meminimalkan pergerakan data dan mempertahankan akses langsung ke sistem eksternal.

Saat sumber Anda mendukung Lakehouse Federation dan Lakeflow Connect, Azure Databricks merekomendasikan Lakeflow Connect jika performa pada volume data yang lebih tinggi dan latensi yang lebih rendah adalah prioritas.
  • Buat koneksi di Unity Catalog dengan kredensial akses dan URL JDBC Anda.
  • Buat katalog asing menggunakan koneksi.
  • Berikan hak istimewa kepada pengguna pada tabel di katalog asing.
  • Jalankan kueri. Data ini didorong ke database eksternal.
Federasi katalog Kueri Katalog Unity secara langsung mengakses tabel asing dalam penyimpanan objek. Federasi katalog tersedia untuk platform yang mendukung akses langsung ke katalog dan layanan penyimpanan mereka. Kueri hanya dijalankan pada komputasi Azure Databricks, yang berarti bahwa federasi katalog lebih hemat biaya dan dioptimalkan performa daripada federasi kueri.
  • Anda sedang bermigrasi ke Unity Catalog, tetapi perlu menerapkannya secara bertahap untuk data yang dikelola dari katalog eksternal.
  • Anda menginginkan model hibrid jangka panjang di mana beberapa data tetap berada di katalog eksternal dan beberapa data dikelola oleh Unity Catalog.
  • Buat koneksi di Katalog Unity untuk mengakses katalog eksternal.
  • Buat kredensial penyimpanan dan lokasi eksternal untuk jalur tabel.
  • Buat katalog asing menggunakan koneksi dan lokasi eksternal.
  • Berikan hak istimewa kepada pengguna pada tabel di katalog asing.
  • Jalankan kueri. Proses ini beroperasi langsung pada penyimpanan objek.

Sumber data yang didukung

Sambungkan ke sumber berikut menggunakan federasi kueri:

Sambungkan ke sumber berikut menggunakan federasi katalog:

Sumber data Spark

Spark Data Source API memungkinkan Anda membaca dan menulis ke database eksternal langsung dari Azure Databricks. Gunakan saat Federasi Lakehouse tidak mendukung sumber Anda, saat Anda memerlukan akses tulis, atau saat Anda memerlukan kontrol lebih besar atas eksekusi dan paralelisasi kueri.

Databricks Runtime mencakup konektor yang dibundel untuk database umum seperti PostgreSQL, SQL Server, MySQL, Snowflake, dan Redshift. Untuk database yang kompatibel dengan JDBC, Anda dapat menggunakan koneksi JDBC Unity Catalog untuk membawa driver Anda sendiri dengan manajemen kredensial terpusat. Anda juga dapat menginstal konektor pihak ketiga pada kluster khusus atau membangun konektor kustom penuh di Python menggunakan PySpark DataSource API.

Untuk instruksi penyiapan dan detail lengkap, lihat Sumber data Spark.

Sumber daya tambahan