Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Azure Databricks har inbyggda nyckelordsbindningar för alla dataformat som stöds internt av Apache Spark. Azure Databricks använder Delta Lake som standardprotokoll för att läsa och skriva data och tabeller, medan Apache Spark använder Parquet. Följande avsnitt beskriver de alternativ och konfigurationer som finns tillgängliga när du frågar varje dataformat på Azure Databricks.
De flesta format stöder skrivkomprimering via alternativet compression . För stödda värden för varje format, se DataFrameWriter alternativ. Azure Databricks kan också direkt läsa förkomprimerade filer i många format och du kan packa upp komprimerade filer på Azure Databricks om det behövs.
Mer information om Apache Spark-datakällor finns i Generic Load/Save Functions (Allmänna Läs in/Spara-funktioner) och Generic File Source Options (Allmänna alternativ för filkälla).
Öppna tabellformat
Tabellformat som stödjer ACID-transaktioner, schemautveckling och interoperabilitet mellan motorer.
| Format | Description |
|---|---|
| Delta Lake | Standardformatet för att läsa och skriva data och tabeller på Azure Databricks. |
| Isberg | Läs och skriv Iceberg-tabeller och samverka med externa Iceberg-motorer. |
| OpenSharing | Läs delade tabeller och data med Open Sharing Protocol. |
Kolumnformat
Binära kolumnformat optimerade för analytisk läsprestanda och komprimering.
| Format | Description |
|---|---|
| Parkettgolv | Det kolumnformat som Apache Spark använder som standard, med effektiv komprimering och kodning. |
| ORCH | Ett kolumnformat med inbyggd komprimering och stöd för lättviktsindex. |
Textbaserade format
Människoläsbara format för utbyte, konfiguration och poster med flexibla eller utvecklande scheman.
| Format | Description |
|---|---|
| JSON | Läs och skriv JSON-filer, inklusive alternativ för flerradsposter och schemainferens. |
| CSV | Läs och skriv avgränsade textfiler med alternativ för rubrikrader, avgränsare och felaktiga poster. |
| XML | Läs och skriv XML-filer genom att ange radtaggen och schemat. |
| Text | Läs och skriv textfiler en rad eller en fil i taget. |
Binära och specialiserade format
Binära serialiseringsformat och Azure Databricks-specifika datakällor.
| Format | Description |
|---|---|
| Avro | Läs och skriv Avro-filer och arbeta med Avro-kodade payloads i streaming. |
| MLflow-experiment | Läs in data från en MLflow-experimentkörning med det anpassade nyckelordet mlflow-experiment. |
Ostrukturerade data
Format och typer för lagring och bearbetning av dokument, bilder, ljud och andra ostrukturerade filer.
| Format | Description |
|---|---|
| Arbeta med ostrukturerad data | Lagra, styra och bearbeta ostrukturerad data såsom dokument, bilder och ljud. |
| Binär | Läs filer som råa binärposter, inklusive bilder och annan ostrukturerad data. |
| Bild | Ladda bilddata för maskininlärningsarbetsbelastningar. Databricks rekommenderar att ladda bilder som binary data. |
| FIL | Spara en styrd referens till en ostrukturerad fil istället för att använda BINARY eller STRING. |
| Inmata filer som FILE-typen | Mata in ostrukturerade filer i tabeller som FILE-referenser med SQL, tabellvärdesfunktioner och Auto Loader. |
| Processa filer med UDF:er | Läs filbytes, extrahera bild- och videometadata och generera härledda filer med UDF:er. |
| FILE-funktionen snabbstart | Kom igång med FILE typen och dess funktioner i Databricks SQL och Databricks Runtime. |
Halvstrukturerade data
Mönster och funktioner för arbete med nästlade och semistrukturerade data i sjöhuset.
| Format | Description |
|---|---|
| Modellera semistrukturerad data | Välj mellan Variant-, JSON-strängar, structs och mappar för att lagra semistrukturerad data. |
| Variant | Lagra semistrukturerad data med typen VARIANT för optimerade läsningar och skrivningar. |
| Omvandla komplexa datatyper | Arbeta med strukturer, arrayer och kartor i Apache Spark. |
| Funktioner med högre ordning | Transformera arrayer och mappar med inbyggda funktioner av högre ordning. |