Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Azure Databricks heeft ingebouwde trefwoordbindingen voor alle gegevensindelingen die systeemeigen worden ondersteund door Apache Spark. Azure Databricks maakt gebruik van Delta Lake als het standaardprotocol voor het lezen en schrijven van gegevens en tabellen, terwijl Apache Spark Parquet gebruikt.
Deze artikelen bieden een overzicht van veel van de opties en configuraties die beschikbaar zijn wanneer u query's uitvoert op gegevens in Azure Databricks.
De volgende gegevensindelingen hebben ingebouwde trefwoordconfiguraties in Apache Spark DataFrames en SQL:
Azure Databricks biedt ook een aangepast trefwoord voor het laden van MLflow-experimenten.
Gegevensindelingen met speciale overwegingen
Voor sommige gegevensindelingen zijn aanvullende configuratie- of speciale overwegingen vereist voor gebruik:
- Databricks raadt aan om afbeeldingen als
binarygegevens te laden. - De meeste indelingen ondersteunen schrijfcompressie via de
compressionoptie. Zie het gedeelte over compressie in de documentatie van elk formaat voor details over de configuratie. Azure Databricks kan ook rechtstreeks vooraf gecomprimeerde bestanden in veel indelingen lezen, en u kunt indien nodig gecomprimeerde bestanden uitpakken in Azure Databricks.-
Op tekst gebaseerd (CSV, JSON, XML, tekst):
none(standaard),bzip2,gzip,lz4,snappy, , endeflatezstd -
Parquet:
snappy(standaard),gzip,lzo,brotli, enlz4zstd -
ORC:
snappy,zlibenlzo -
Avro:
snappy(standaard),deflate,bzip2, enxzzstandard
-
Op tekst gebaseerd (CSV, JSON, XML, tekst):
Raadpleeg Algemene functies voor laden/opslaan en Algemene opties voor bestandsbronnen voor meer informatie over Apache Spark-gegevensbronnen.