Options de format de données

Azure Databricks a des liaisons de mots clés intégrées pour tous les formats de données pris en charge en mode natif par Apache Spark. Azure Databricks utilise Delta Lake comme protocole par défaut pour lire et écrire des données et des tables, tandis que Apache Spark utilise Parquet. Les sections suivantes décrivent les options et configurations disponibles lorsque vous interrogez chaque format de données sur Azure Databricks.

La plupart des formats prennent en charge la compression d’écriture via l’option compression . Pour les valeurs prises en charge pour chaque format, voir DataFrameWriter les options. Azure Databricks peut également lire directement des fichiers précompressés dans de nombreux formats, et vous pouvez décompresser les fichiers compressés sur Azure Databricks si nécessaire.

Pour plus d’informations sur les sources de données Apache Spark, consultez Generic Load/Save Functions et Generic File Source Options.

Formats de table ouverts

Des formats de table qui prennent en compte les transactions ACID, l’évolution du schéma et l’interopérabilité entre moteurs.

Format Description
Lac Delta Le format par défaut pour lire et écrire des données et des tables sur Azure Databricks.
Iceberg Lire et écrire des tables Iceberg et assurer l’interopérabilité avec des moteurs Iceberg externes.
OpenSharing Lisez les tables et données partagées en utilisant le protocole de partage ouvert.

Formats en colonnes

Formats binaires en colonne optimisés pour la performance analytique de lecture et la compression.

Format Description
Parquet Le format en colonnes utilisé par Apache Spark par défaut, avec une compression et un encodage efficaces.
ORQUE Un format en colonne avec compression intégrée et prise en charge des index légers.

Formats textuels

Formats lisibles par l’homme pour l’échange, la configuration et les enregistrements avec des schémas flexibles ou évolutifs.

Format Description
JSON Lire et écrire des fichiers JSON, y compris des options pour les enregistrements multilignes et l’inférence de schéma.
CSV Lire et écrire des fichiers texte délimités, avec des options pour les en-têtes, délimiteurs et enregistrements malformés.
XML Lisez et écrivez des fichiers XML en spécifiant la balise ligne et le schéma.
Texte Lisez et écrivez des fichiers en texte brut, ligne par ligne ou un fichier à la fois.

Formats binaires et spécialisés

Formats de sérialisation binaire et sources de données spécifiques à Azure Databricks.

Format Description
Avro Lire et écrire des fichiers Avro et travailler avec des charges utiles encodées en Avro en streaming.
Expérience MLflow Chargez les données d’exécution d’expérience MLflow à l’aide du mot-clé personnalisé mlflow-experiment.

Données non structurées

Formats et types pour stocker et traiter des documents, images, fichiers audio et autres fichiers non structurés.

Format Description
Travail avec des données non structurées Stockez, gérez et traitez des données non structurées telles que des documents, des images et des audios.
Binaire Lisez les fichiers sous forme d’enregistrements binaires bruts, y compris des images et d’autres données non structurées.
Image Chargez des données d'image pour les tâches d'apprentissage automatique. Databricks recommande de charger des images sous forme binary de données.
FILE Stocker une référence gouvernée à un fichier non structuré au lieu d’utiliser BINARY ou STRING.
Importer des fichiers en tant que type FILE Importer des fichiers non structurés dans des tables sous forme de références FILE avec SQL, des fonctions à valeurs de table et Auto Loader.
Fichiers de processus avec des UDF Lire des octets de fichiers, extraire des métadonnées d’images et de vidéos, et générer des fichiers dérivés avec des UDF.
Démarrage rapide des fonctions FILE Commencez avec le FILE type et ses fonctions dans Databricks SQL et Databricks Runtime.

Données semi-structurées

Modèles et fonctions pour travailler avec des données imbriquées et semi-structurées dans le lakehouse.

Format Description
Modéliser des données semi-structurées Choisissez entre Variant, chaînes JSON, structs et cartes pour stocker des données semi-structurées.
Variant Stockez des données semi-structurées en utilisant le VARIANT type pour des lectures et écritures optimisées.
Transformer des types de données complexes Travailler avec des structs, des tableaux et des cartes dans Apache Spark.
Fonctions d’ordre supérieur Transformez les tableaux et les mappages en utilisant des fonctions d’ordre supérieur intégrées.