Alternativ för dataformat

Azure Databricks har inbyggda nyckelordsbindningar för alla dataformat som stöds internt av Apache Spark. Azure Databricks använder Delta Lake som standardprotokoll för att läsa och skriva data och tabeller, medan Apache Spark använder Parquet. Följande avsnitt beskriver de alternativ och konfigurationer som finns tillgängliga när du frågar varje dataformat på Azure Databricks.

De flesta format stöder skrivkomprimering via alternativet compression . För stödda värden för varje format, se DataFrameWriter alternativ. Azure Databricks kan också direkt läsa förkomprimerade filer i många format och du kan packa upp komprimerade filer på Azure Databricks om det behövs.

Mer information om Apache Spark-datakällor finns i Generic Load/Save Functions (Allmänna Läs in/Spara-funktioner) och Generic File Source Options (Allmänna alternativ för filkälla).

Öppna tabellformat

Tabellformat som stödjer ACID-transaktioner, schemautveckling och interoperabilitet mellan motorer.

Format Description
Delta Lake Standardformatet för att läsa och skriva data och tabeller på Azure Databricks.
Isberg Läs och skriv Iceberg-tabeller och samverka med externa Iceberg-motorer.
OpenSharing Läs delade tabeller och data med Open Sharing Protocol.

Kolumnformat

Binära kolumnformat optimerade för analytisk läsprestanda och komprimering.

Format Description
Parkettgolv Det kolumnformat som Apache Spark använder som standard, med effektiv komprimering och kodning.
ORCH Ett kolumnformat med inbyggd komprimering och stöd för lättviktsindex.

Textbaserade format

Människoläsbara format för utbyte, konfiguration och poster med flexibla eller utvecklande scheman.

Format Description
JSON Läs och skriv JSON-filer, inklusive alternativ för flerradsposter och schemainferens.
CSV Läs och skriv avgränsade textfiler med alternativ för rubrikrader, avgränsare och felaktiga poster.
XML Läs och skriv XML-filer genom att ange radtaggen och schemat.
Text Läs och skriv textfiler en rad eller en fil i taget.

Binära och specialiserade format

Binära serialiseringsformat och Azure Databricks-specifika datakällor.

Format Description
Avro Läs och skriv Avro-filer och arbeta med Avro-kodade payloads i streaming.
MLflow-experiment Läs in data från en MLflow-experimentkörning med det anpassade nyckelordet mlflow-experiment.

Ostrukturerade data

Format och typer för lagring och bearbetning av dokument, bilder, ljud och andra ostrukturerade filer.

Format Description
Arbeta med ostrukturerad data Lagra, styra och bearbeta ostrukturerad data såsom dokument, bilder och ljud.
Binär Läs filer som råa binärposter, inklusive bilder och annan ostrukturerad data.
Bild Ladda bilddata för maskininlärningsarbetsbelastningar. Databricks rekommenderar att ladda bilder som binary data.
FIL Spara en styrd referens till en ostrukturerad fil istället för att använda BINARY eller STRING.
Inmata filer som FILE-typen Mata in ostrukturerade filer i tabeller som FILE-referenser med SQL, tabellvärdesfunktioner och Auto Loader.
Processa filer med UDF:er Läs filbytes, extrahera bild- och videometadata och generera härledda filer med UDF:er.
FILE-funktionen snabbstart Kom igång med FILE typen och dess funktioner i Databricks SQL och Databricks Runtime.

Halvstrukturerade data

Mönster och funktioner för arbete med nästlade och semistrukturerade data i sjöhuset.

Format Description
Modellera semistrukturerad data Välj mellan Variant-, JSON-strängar, structs och mappar för att lagra semistrukturerad data.
Variant Lagra semistrukturerad data med typen VARIANT för optimerade läsningar och skrivningar.
Omvandla komplexa datatyper Arbeta med strukturer, arrayer och kartor i Apache Spark.
Funktioner med högre ordning Transformera arrayer och mappar med inbyggda funktioner av högre ordning.