Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Azure Databricks memiliki pengikatan kata kunci bawaan untuk semua format data yang didukung secara asli oleh Apache Spark. Azure Databricks menggunakan Delta Lake sebagai protokol default untuk membaca dan menulis data dan tabel, sedangkan Apache Spark menggunakan Parquet. Bagian berikut menjelaskan opsi dan konfigurasi yang tersedia saat Anda melakukan query pada setiap format data di Azure Databricks.
Sebagian besar format mendukung kompresi tulis melalui compression opsi . Untuk nilai yang didukung untuk setiap format, lihat DataFrameWriter opsi. Azure Databricks juga dapat langsung membaca file pra-kompresi dalam banyak format, dan Anda dapat membuka zip file terkompresi pada Azure Databricks jika perlu.
Untuk informasi selengkapnya tentang sumber data Apache Spark, lihat Generic Load/Save Functions dan Generic File Source Options.
Format tabel terbuka
Format tabel yang mendukung transaksi ACID, evolusi skema, dan interoperabilitas antar mesin.
| Format | Description |
|---|---|
| Danau Delta | Format default untuk membaca dan menulis data serta tabel di Azure Databricks. |
| Gunung es | Membaca dan menulis tabel Iceberg serta berinteroperasi dengan mesin Iceberg eksternal. |
| OpenSharing | Membaca tabel dan data bersama menggunakan protokol berbagi terbuka. |
Format kolom
Format kolom biner yang dioptimalkan untuk kinerja bacaan analitik dan kompresi.
| Format | Description |
|---|---|
| Parket | Format kolom yang digunakan Apache Spark secara default, dengan kompresi dan pengkodean yang efisien. |
| ORC | Format kolom dengan kompresi bawaan dan dukungan untuk indeks ringan. |
Format berbasis teks
Format yang dapat dibaca manusia untuk pertukaran data, konfigurasi, dan catatan dengan skema yang fleksibel atau terus berkembang.
| Format | Description |
|---|---|
| JSON | Baca dan tulis file JSON, termasuk opsi untuk rekaman multiline dan inferensi skema. |
| CSV | Baca dan tulis file teks yang terbatas, dengan opsi untuk header, delimiter, dan catatan yang cacat. |
| XML | Baca dan tulis file XML dengan menentukan tag baris dan skema. |
| Teks | Baca dan tulis file teks biasa satu baris atau satu file pada satu waktu. |
Format biner dan khusus
Format serialisasi biner dan sumber data khusus Azure Databricks.
| Format | Description |
|---|---|
| Avro | Membaca dan menulis file Avro serta bekerja dengan muatan berenkode Avro dalam streaming. |
| Eksperimen MLflow | Muat data jalankan eksperimen MLflow menggunakan kata kunci kustom mlflow-experiment . |
Data yang tidak terstruktur
Format dan jenis untuk menyimpan dan memproses dokumen, gambar, audio, dan file tidak terstruktur lainnya.
| Format | Description |
|---|---|
| Bekerja dengan data tidak terstruktur | Menyimpan, mengatur, dan memproses data tidak terstruktur seperti dokumen, gambar, dan audio. |
| Biner | Membaca file sebagai catatan biner mentah, termasuk gambar dan data tidak terstruktur lainnya. |
| Citra | Muat data gambar untuk beban kerja machine learning. Databricks merekomendasikan memuat gambar sebagai binary data. |
| File | Simpan referensi terkelola ke berkas tidak terstruktur alih-alih menggunakan BINARY atau STRING. |
| Memasukkan file sebagai tipe FILE | Muat file tak terstruktur ke dalam tabel sebagai referensi FILE menggunakan SQL, fungsi bernilai tabel, dan Auto Loader. |
| Proses file dengan UDF | Baca byte file, ekstrak metadata gambar dan video, serta hasilkan file turunan dengan UDF. |
| Fungsi FILE mulai cepat | Mulailah dengan FILE tipe dan fungsinya di Databricks SQL dan Databricks Runtime. |
Data semiterstruktur
Pola dan fungsi untuk bekerja dengan data bersarang dan semi-terstruktur di rumah danau.
| Format | Description |
|---|---|
| Memodelkan data semi-terstruktur | Pilih antara Variant, string JSON, struct, dan peta untuk menyimpan data semi-terstruktur. |
| Varian | Simpan data semi-terstruktur menggunakan tipe VARIANT untuk operasi baca dan tulis yang dioptimalkan. |
| Mentransformasi jenis data kompleks | Bekerja dengan struct, array, dan peta di Apache Spark. |
| Fungsi tingkat tinggi | Transformasikan array dan map menggunakan fungsi orde tinggi bawaan. |