Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Azure Databricks menyediakan beberapa opsi untuk mengkueri dan mengakses data dalam database dan katalog eksternal tanpa memigrasikan data Anda. Pilih pendekatan berdasarkan pola akses, persyaratan tata kelola, kebutuhan tulis, dan preferensi komputasi Anda.
Pilih pendekatan
Tabel berikut membandingkan federasi kueri dan federasi katalog untuk membantu Anda memilih pendekatan yang tepat.
| Approach | Deskripsi | Pelaksanaan kueri | Menulis dukungan | Governance | Paling cocok untuk |
|---|---|---|---|---|---|
| Federasi kueri | Jalankan kueri terfederasi pada basis data relasional eksternal menggunakan JDBC, dengan pendorongan kueri otomatis dan tata kelola Unity Catalog melalui katalog eksternal. | Didorong ke database eksternal menggunakan JDBC. Kueri dijalankan baik pada Azure Databricks maupun komputasi jarak jauh. | Tidak didukung (baca-saja). | Katalog asing Unity Catalog dengan kontrol akses tingkat tabel. | Pelaporan ad hoc, BI, dan akses bukti konsep ke database operasional. |
| Federasi katalog | Sambungkan platform katalog eksternal (seperti Apache Hive Metastore, AWS Glue, atau Snowflake) sehingga Anda dapat mengkueri datanya langsung di penyimpanan objek. | Berjalan langsung terhadap penyimpanan objek pada komputasi Azure Databricks saja. Lebih hemat biaya dan dioptimalkan untuk performa daripada federasi kueri. | Tidak didukung (baca-saja). | Katalog asing Unity Catalog dengan kontrol akses tingkat tabel. | Bermigrasi ke Unity Catalog secara bertahap, atau mempertahankan model hibrid jangka panjang dengan data dalam katalog eksternal. |
Federasi Lakehouse
Lakehouse Federation adalah platform federasi kueri Azure Databricks. Ini menyediakan akses baca-saja yang terkelola ke data eksternal melalui foreign catalog Unity Catalog, dengan pushdown kueri otomatis dan kontrol akses terperinci di tingkat tabel.
Ada dua jenis Federasi Lakehouse: federasi kueri dan federasi katalog.
Federasi kueri dibandingkan dengan federasi katalog
Tabel berikut ini menjelaskan perbedaan utama antara federasi kueri dan federasi katalog.
| Approach | Jalur kueri | Skenario penggunaan | Gambaran umum langkah-langkah |
|---|---|---|---|
| Federasi kueri | Kueri Katalog Unity dikirimkan ke database asing menggunakan JDBC. Kueri dijalankan baik di Azure Databricks maupun menggunakan komputasi jarak jauh. |
Saat sumber Anda mendukung Lakehouse Federation dan Lakeflow Connect, Azure Databricks merekomendasikan Lakeflow Connect jika performa pada volume data yang lebih tinggi dan latensi yang lebih rendah adalah prioritas. |
|
| Federasi katalog | Kueri Katalog Unity secara langsung mengakses tabel asing dalam penyimpanan objek. Federasi katalog tersedia untuk platform yang mendukung akses langsung ke katalog dan layanan penyimpanan mereka. Kueri hanya dijalankan pada komputasi Azure Databricks, yang berarti bahwa federasi katalog lebih hemat biaya dan dioptimalkan performa daripada federasi kueri. |
|
|
Sumber data yang didukung
Sambungkan ke sumber berikut menggunakan federasi kueri:
- MySQL
- PostgreSQL
- Teradata
- Oracle
- Amazon Redshift
- Salesforce Data 360
- Snowflake
- Microsoft SQL Server
- Azure Synapse (Gudang Data SQL)
- Google BigQuery
- Databricks
Sambungkan ke sumber berikut menggunakan federasi katalog:
Sumber data Spark
Spark Data Source API memungkinkan Anda membaca dan menulis ke database eksternal langsung dari Azure Databricks. Gunakan saat Federasi Lakehouse tidak mendukung sumber Anda, saat Anda memerlukan akses tulis, atau saat Anda memerlukan kontrol lebih besar atas eksekusi dan paralelisasi kueri.
Databricks Runtime mencakup konektor yang dibundel untuk database umum seperti PostgreSQL, SQL Server, MySQL, Snowflake, dan Redshift. Untuk database yang kompatibel dengan JDBC, Anda dapat menggunakan koneksi JDBC Unity Catalog untuk membawa driver Anda sendiri dengan manajemen kredensial terpusat. Anda juga dapat menginstal konektor pihak ketiga pada kluster khusus atau membangun konektor kustom penuh di Python menggunakan PySpark DataSource API.
Untuk instruksi penyiapan dan detail lengkap, lihat Sumber data Spark.