Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Azure Databricks, Apache Spark tarafından yerel olarak desteklenen tüm veri biçimleri için yerleşik anahtar sözcük bağlamalarına sahiptir. Azure Databricks verileri ve tabloları okumak ve yazmak için varsayılan protokol olarak Delta Lake'i, Apache Spark ise Parquet'i kullanır. Aşağıdaki bölümler, Azure Databricks'te her veri formatını sorguladığınızda mevcut seçenekleri ve yapılandırmaları açıklar.
Çoğu biçim, compression seçeneği aracılığıyla yazma sıkıştırmasını destekler. Her format için desteklenen değerler için seçeneklere bakınızDataFrameWriter. Azure Databricks, birçok biçimdeki önceden sıkıştırılmış dosyaları doğrudan okuyabilir ve gerekirse Azure Databricks'te sıkıştırılmış dosyaların sıkıştırmasını açabilirsiniz.
Apache Spark veri kaynakları hakkında daha fazla bilgi için bkz. Genel Yükleme/Kaydetme İşlevleri ve Genel Veri Kaynağı Seçenekleri.
Açık tablo formatları
ACID işlemlerini, şema evrimini ve motorlar arasında birlikte çalışabilirliği destekleyen tablo formatları.
| Format | Description |
|---|---|
| Delta Gölü | Azure Databricks'te veri ve tablo okuma ve yazma için varsayılan format. |
| Buzdağı | Iceberg tablolarını okuyun ve yazın, ayrıca harici Iceberg motorlarıyla birlikte çalışın. |
| OpenSharing | Açık paylaşım protokolü kullanarak paylaşılan tabloları ve verileri okuyun. |
Sütunlu biçimler
Analitik okuma performansı ve sıkıştırma için optimize edilmiş ikili sütunlu formatlar.
| Format | Description |
|---|---|
| Parke | Apache Spark'ın varsayılan olarak kullandığı sütunlu format, verimli sıkıştırma ve kodlama sunar. |
| ORC | Dahili sıkıştırma ve hafif indeksler desteğine sahip sütunlu bir format. |
Metin tabanlı biçimler
Değişiklik, yapılandırma ve kayıtlar için esnek veya gelişen şemalarla insan tarafından okunabilir formatlar.
| Format | Description |
|---|---|
| JSON | JSON dosyalarını okuyun ve yazın; çok hatlı kayıtlar ve şema çıkarımı seçenekleri dahil. |
| CSV Dosyası | Başlıklar, ayıraçlar ve bozuk biçimli kayıtlar için seçeneklerle ayraçlarla ayrılmış metin dosyalarını okuyun ve yazın. |
| XML | XML dosyalarını okuyup yazmak için satır etiketi ve şemayı belirtin. |
| Metin | Düz metin dosyalarını tek seferde bir satır veya bir dosya olarak okuyun ve yazın. |
İkili ve uzmanlaşmış formatlar
İkili serileştirme biçimleri ve Azure Databricks’e özgü veri kaynakları.
| Format | Description |
|---|---|
| Avro | Avro dosyalarını okuyup yazıyor ve yayında Avro kodlu yüklerle çalışıyor. |
| MLflow denemesi | MLflow deney çalıştırma verilerini özel mlflow-experiment anahtar sözcüğünü kullanarak yükleyin. |
Yapılandırılmamış veriler
Belgeler, görseller, ses ve diğer yapılandırılmamış dosyaların depolanması ve işlemesi için formatlar ve türler.
| Format | Description |
|---|---|
| Yapılandırılmamış verilerle çalışma | Belgeler, görüntüler ve ses gibi yapılandırılmamış verileri depolar, yönetir ve işler. |
| İkili | Dosyaları, görüntüler ve diğer yapılandırılmamış veriler dahil olmak üzere ham ikili kayıtlar olarak okuyun. |
| Görüntü | Makine öğrenimi iş yükleri için görüntü verisi yükleyin. Databricks, görüntülerin veri olarak binary yüklenmesini önerir. |
| DOSYA |
BINARY veya STRING kullanmak yerine, yapılandırılmamış bir dosyaya yönelik yönetilen bir referans depolayın. |
| Dosyaları FILE tipi olarak alın | SQL, tablo değerli işlevler ve Auto Loader kullanarak yapılandırılmamış dosyaları tablolara FILE referansları olarak içe aktarın. |
| UDF'lerle dosya işleme | Dosya baytlarını okuyun, görüntü ve video meta verilerini çıkarın ve UDF'lerle türetilmiş dosyalar oluşturun. |
| FILE fonksiyonları hızlı başlatma | Databricks SQL ve Databricks Runtime'da FILE türü ve işlevleri hakkında bilgi edinin. |
Yarı yapılandırılmış veriler
Lakehouse'ta iç içe geçmiş ve yarı yapılandırılmış verilerle çalışmaya yönelik desenler ve işlevler.
| Format | Description |
|---|---|
| Yarı yapılandırılmış verileri modelleyin | Yarı yapılandırılmış veri depolamak için Varyant, JSON dizili, yapı ve haritalar arasında seçim yapabilirsiniz. |
| Varyant | Yarı yapılandırılmış verileri optimize edilmiş okuma ve yazma için bu VARIANT tip kullanılarak depolayın. |
| Karmaşık veri türlerini dönüştürme | Apache Spark'ta yapılar, diziler ve haritalarla çalışın. |
| Daha yüksek düzeyli işlevler | Yerleşik üst dereceli fonksiyonlar kullanarak dizileri ve haritaları dönüştürün. |