Možnosti formátu dat

Azure Databricks má integrované vazby klíčových slov pro všechny formáty dat nativně podporované Apache Sparkem. Azure Databricks používá Delta Lake jako výchozí protokol pro čtení a zápis dat a tabulek, zatímco Apache Spark používá Parquet. Následující sekce popisují možnosti a konfigurace dostupné při dotazování každého datového formátu na Azure Databricks.

Většina formátů podporuje kompresi při zápisu pomocí volby compression. Pro podporované hodnoty pro každý formát viz DataFrameWriter možnosti. Azure Databricks mohou také přímo číst předkomprimované soubory v mnoha formátech a v případě potřeby můžete komprimované soubory rozbalit na Azure Databricks.

Další informace o zdrojích dat Apache Sparku najdete v tématech věnovaných obecným funkcím pro načítání a ukládání a generickým možnostem zdrojů souborů.

Formáty otevřených tabulek

Formáty tabulek podporující transakce ACID, vývoj schématu a interoperabilitu napříč enginy.

Format Description
Delta Lake Výchozí formát pro čtení a zápis dat a tabulek na Azure Databricks.
Iceberg Číst a zapisovat tabulky Iceberg a zajišťovat interoperabilitu s externími enginy Iceberg.
OpenSharing Čtěte sdílené tabulky a data pomocí otevřeného protokolu sdílení.

Sloupcové formáty

Binární sloupcové formáty optimalizované pro analytický výkon čtení a kompresi.

Format Description
Parkety Sloupcový formát, který Apache Spark používá ve výchozím nastavení, s efektivní kompresí a kódováním.
ORC Sloupcový formát s vestavěnou kompresí a podporou lehkých indexů.

Textové formáty

Lidsky čitelné formáty pro výměnu, konfiguraci a záznamy s flexibilními nebo vyvíjejícími se schémata.

Format Description
JSON Čtěte a zapisujte JSON soubory, včetně možností pro víceřádkové záznamy a inferenci schémat.
CSV Čtěte a zapisujte textové soubory s oddělenými částmi s možnostmi hlaviček, oddělovačů a deformovaných záznamů.
XML Čtěte a zapisujte XML soubory zadáním řádkového tagu a schématu.
Text Čtěte a pište prosté textové soubory po řádcích nebo po jednom souboru.

Binární a specializované formáty

Binární serializační formáty a Azure Databricks-specifické datové zdroje.

Format Description
Avro Číst a zapisovat soubory Avro a pracovat s datovými částmi kódovanými ve formátu Avro v rámci streamování.
Experiment MLflow Načtení dat běhu experimentu MLflow pomocí vlastního klíčového slova mlflow-experiment.

Nestrukturovaná data

Formáty a typy pro ukládání a zpracování dokumentů, obrázků, zvuku a dalších nestrukturovaných souborů.

Format Description
Práce s nestrukturovanými daty Ukládejte, spravujte a zpracováváte nestrukturovaná data, jako jsou dokumenty, obrázky a zvuk.
Binární Čtěte soubory jako surové binární záznamy, včetně obrázků a dalších nestrukturovaných dat.
Obrázek Načítání obrazových dat pro úkoly zaměřené na strojové učení. Databricks doporučuje načítat obrázky jako data binary.
SOUBOR Ukládejte řízenou referenci na nestrukturovaný soubor místo použití BINARY nebo STRING.
Importovat soubory jako typ FILE Ingest nestrukturovaných souborů do tabulek jako FILE referencí pomocí SQL, tabulových funkcí a Auto Loaderu.
Procesní soubory s UDF Čtěte bajty souborů, extrahujtejte metadata obrázků a videí a generujte odvozené soubory pomocí UDF.
Rychlý start funkcí FILE Začněte s typem FILE a jeho funkcemi v Databricks SQL a Databricks Runtime.

Částečně strukturovaná data

Vzory a funkce pro práci s vnořenými a polostrukturovanými daty v jezerním domku.

Format Description
Modelujte polostrukturovaná data Vyberte si mezi variantními řetězci, JSON řetězci, strukturami a mapami pro ukládání polostrukturovaných dat.
Varianta Ukládejte polostrukturovaná data s tímto typem VARIANT pro optimalizované čtení a zápisy.
Transformace složitých datových typů Pracujte se strukturami, poli a mapami v Apache Sparku.
Funkce vyššího řádu Transformujte pole a mapy pomocí vestavěných funkcí vyššího řádu.