Pilihan format data

Azure Databricks memiliki pengikatan kata kunci bawaan untuk semua format data yang didukung secara asli oleh Apache Spark. Azure Databricks menggunakan Delta Lake sebagai protokol default untuk membaca dan menulis data dan tabel, sedangkan Apache Spark menggunakan Parquet. Bagian berikut menjelaskan opsi dan konfigurasi yang tersedia saat Anda melakukan query pada setiap format data di Azure Databricks.

Sebagian besar format mendukung kompresi tulis melalui compression opsi . Untuk nilai yang didukung untuk setiap format, lihat DataFrameWriter opsi. Azure Databricks juga dapat langsung membaca file pra-kompresi dalam banyak format, dan Anda dapat membuka zip file terkompresi pada Azure Databricks jika perlu.

Untuk informasi selengkapnya tentang sumber data Apache Spark, lihat Generic Load/Save Functions dan Generic File Source Options.

Format tabel terbuka

Format tabel yang mendukung transaksi ACID, evolusi skema, dan interoperabilitas antar mesin.

Format Description
Danau Delta Format default untuk membaca dan menulis data serta tabel di Azure Databricks.
Gunung es Membaca dan menulis tabel Iceberg serta berinteroperasi dengan mesin Iceberg eksternal.
OpenSharing Membaca tabel dan data bersama menggunakan protokol berbagi terbuka.

Format kolom

Format kolom biner yang dioptimalkan untuk kinerja bacaan analitik dan kompresi.

Format Description
Parket Format kolom yang digunakan Apache Spark secara default, dengan kompresi dan pengkodean yang efisien.
ORC Format kolom dengan kompresi bawaan dan dukungan untuk indeks ringan.

Format berbasis teks

Format yang dapat dibaca manusia untuk pertukaran data, konfigurasi, dan catatan dengan skema yang fleksibel atau terus berkembang.

Format Description
JSON Baca dan tulis file JSON, termasuk opsi untuk rekaman multiline dan inferensi skema.
CSV Baca dan tulis file teks yang terbatas, dengan opsi untuk header, delimiter, dan catatan yang cacat.
XML Baca dan tulis file XML dengan menentukan tag baris dan skema.
Teks Baca dan tulis file teks biasa satu baris atau satu file pada satu waktu.

Format biner dan khusus

Format serialisasi biner dan sumber data khusus Azure Databricks.

Format Description
Avro Membaca dan menulis file Avro serta bekerja dengan muatan berenkode Avro dalam streaming.
Eksperimen MLflow Muat data jalankan eksperimen MLflow menggunakan kata kunci kustom mlflow-experiment .

Data yang tidak terstruktur

Format dan jenis untuk menyimpan dan memproses dokumen, gambar, audio, dan file tidak terstruktur lainnya.

Format Description
Bekerja dengan data tidak terstruktur Menyimpan, mengatur, dan memproses data tidak terstruktur seperti dokumen, gambar, dan audio.
Biner Membaca file sebagai catatan biner mentah, termasuk gambar dan data tidak terstruktur lainnya.
Citra Muat data gambar untuk beban kerja machine learning. Databricks merekomendasikan memuat gambar sebagai binary data.
File Simpan referensi terkelola ke berkas tidak terstruktur alih-alih menggunakan BINARY atau STRING.
Memasukkan file sebagai tipe FILE Muat file tak terstruktur ke dalam tabel sebagai referensi FILE menggunakan SQL, fungsi bernilai tabel, dan Auto Loader.
Proses file dengan UDF Baca byte file, ekstrak metadata gambar dan video, serta hasilkan file turunan dengan UDF.
Fungsi FILE mulai cepat Mulailah dengan FILE tipe dan fungsinya di Databricks SQL dan Databricks Runtime.

Data semiterstruktur

Pola dan fungsi untuk bekerja dengan data bersarang dan semi-terstruktur di rumah danau.

Format Description
Memodelkan data semi-terstruktur Pilih antara Variant, string JSON, struct, dan peta untuk menyimpan data semi-terstruktur.
Varian Simpan data semi-terstruktur menggunakan tipe VARIANT untuk operasi baca dan tulis yang dioptimalkan.
Mentransformasi jenis data kompleks Bekerja dengan struct, array, dan peta di Apache Spark.
Fungsi tingkat tinggi Transformasikan array dan map menggunakan fungsi orde tinggi bawaan.