Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Azure Databricks má integrované vazby klíčových slov pro všechny formáty dat nativně podporované Apache Sparkem. Azure Databricks používá Delta Lake jako výchozí protokol pro čtení a zápis dat a tabulek, zatímco Apache Spark používá Parquet. Následující sekce popisují možnosti a konfigurace dostupné při dotazování každého datového formátu na Azure Databricks.
Většina formátů podporuje kompresi při zápisu pomocí volby compression. Pro podporované hodnoty pro každý formát viz DataFrameWriter možnosti. Azure Databricks mohou také přímo číst předkomprimované soubory v mnoha formátech a v případě potřeby můžete komprimované soubory rozbalit na Azure Databricks.
Další informace o zdrojích dat Apache Sparku najdete v tématech věnovaných obecným funkcím pro načítání a ukládání a generickým možnostem zdrojů souborů.
Formáty otevřených tabulek
Formáty tabulek podporující transakce ACID, vývoj schématu a interoperabilitu napříč enginy.
| Format | Description |
|---|---|
| Delta Lake | Výchozí formát pro čtení a zápis dat a tabulek na Azure Databricks. |
| Iceberg | Číst a zapisovat tabulky Iceberg a zajišťovat interoperabilitu s externími enginy Iceberg. |
| OpenSharing | Čtěte sdílené tabulky a data pomocí otevřeného protokolu sdílení. |
Sloupcové formáty
Binární sloupcové formáty optimalizované pro analytický výkon čtení a kompresi.
| Format | Description |
|---|---|
| Parkety | Sloupcový formát, který Apache Spark používá ve výchozím nastavení, s efektivní kompresí a kódováním. |
| ORC | Sloupcový formát s vestavěnou kompresí a podporou lehkých indexů. |
Textové formáty
Lidsky čitelné formáty pro výměnu, konfiguraci a záznamy s flexibilními nebo vyvíjejícími se schémata.
| Format | Description |
|---|---|
| JSON | Čtěte a zapisujte JSON soubory, včetně možností pro víceřádkové záznamy a inferenci schémat. |
| CSV | Čtěte a zapisujte textové soubory s oddělenými částmi s možnostmi hlaviček, oddělovačů a deformovaných záznamů. |
| XML | Čtěte a zapisujte XML soubory zadáním řádkového tagu a schématu. |
| Text | Čtěte a pište prosté textové soubory po řádcích nebo po jednom souboru. |
Binární a specializované formáty
Binární serializační formáty a Azure Databricks-specifické datové zdroje.
| Format | Description |
|---|---|
| Avro | Číst a zapisovat soubory Avro a pracovat s datovými částmi kódovanými ve formátu Avro v rámci streamování. |
| Experiment MLflow | Načtení dat běhu experimentu MLflow pomocí vlastního klíčového slova mlflow-experiment. |
Nestrukturovaná data
Formáty a typy pro ukládání a zpracování dokumentů, obrázků, zvuku a dalších nestrukturovaných souborů.
| Format | Description |
|---|---|
| Práce s nestrukturovanými daty | Ukládejte, spravujte a zpracováváte nestrukturovaná data, jako jsou dokumenty, obrázky a zvuk. |
| Binární | Čtěte soubory jako surové binární záznamy, včetně obrázků a dalších nestrukturovaných dat. |
| Obrázek | Načítání obrazových dat pro úkoly zaměřené na strojové učení. Databricks doporučuje načítat obrázky jako data binary. |
| SOUBOR | Ukládejte řízenou referenci na nestrukturovaný soubor místo použití BINARY nebo STRING. |
| Importovat soubory jako typ FILE | Ingest nestrukturovaných souborů do tabulek jako FILE referencí pomocí SQL, tabulových funkcí a Auto Loaderu. |
| Procesní soubory s UDF | Čtěte bajty souborů, extrahujtejte metadata obrázků a videí a generujte odvozené soubory pomocí UDF. |
| Rychlý start funkcí FILE | Začněte s typem FILE a jeho funkcemi v Databricks SQL a Databricks Runtime. |
Částečně strukturovaná data
Vzory a funkce pro práci s vnořenými a polostrukturovanými daty v jezerním domku.
| Format | Description |
|---|---|
| Modelujte polostrukturovaná data | Vyberte si mezi variantními řetězci, JSON řetězci, strukturami a mapami pro ukládání polostrukturovaných dat. |
| Varianta | Ukládejte polostrukturovaná data s tímto typem VARIANT pro optimalizované čtení a zápisy. |
| Transformace složitých datových typů | Pracujte se strukturami, poli a mapami v Apache Sparku. |
| Funkce vyššího řádu | Transformujte pole a mapy pomocí vestavěných funkcí vyššího řádu. |