Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Azure Databricks a des liaisons de mots clés intégrées pour tous les formats de données pris en charge en mode natif par Apache Spark. Azure Databricks utilise Delta Lake comme protocole par défaut pour lire et écrire des données et des tables, tandis que Apache Spark utilise Parquet. Les sections suivantes décrivent les options et configurations disponibles lorsque vous interrogez chaque format de données sur Azure Databricks.
La plupart des formats prennent en charge la compression d’écriture via l’option compression . Pour les valeurs prises en charge pour chaque format, voir DataFrameWriter les options. Azure Databricks peut également lire directement des fichiers précompressés dans de nombreux formats, et vous pouvez décompresser les fichiers compressés sur Azure Databricks si nécessaire.
Pour plus d’informations sur les sources de données Apache Spark, consultez Generic Load/Save Functions et Generic File Source Options.
Formats de table ouverts
Des formats de table qui prennent en compte les transactions ACID, l’évolution du schéma et l’interopérabilité entre moteurs.
| Format | Description |
|---|---|
| Lac Delta | Le format par défaut pour lire et écrire des données et des tables sur Azure Databricks. |
| Iceberg | Lire et écrire des tables Iceberg et assurer l’interopérabilité avec des moteurs Iceberg externes. |
| OpenSharing | Lisez les tables et données partagées en utilisant le protocole de partage ouvert. |
Formats en colonnes
Formats binaires en colonne optimisés pour la performance analytique de lecture et la compression.
| Format | Description |
|---|---|
| Parquet | Le format en colonnes utilisé par Apache Spark par défaut, avec une compression et un encodage efficaces. |
| ORQUE | Un format en colonne avec compression intégrée et prise en charge des index légers. |
Formats textuels
Formats lisibles par l’homme pour l’échange, la configuration et les enregistrements avec des schémas flexibles ou évolutifs.
| Format | Description |
|---|---|
| JSON | Lire et écrire des fichiers JSON, y compris des options pour les enregistrements multilignes et l’inférence de schéma. |
| CSV | Lire et écrire des fichiers texte délimités, avec des options pour les en-têtes, délimiteurs et enregistrements malformés. |
| XML | Lisez et écrivez des fichiers XML en spécifiant la balise ligne et le schéma. |
| Texte | Lisez et écrivez des fichiers en texte brut, ligne par ligne ou un fichier à la fois. |
Formats binaires et spécialisés
Formats de sérialisation binaire et sources de données spécifiques à Azure Databricks.
| Format | Description |
|---|---|
| Avro | Lire et écrire des fichiers Avro et travailler avec des charges utiles encodées en Avro en streaming. |
| Expérience MLflow | Chargez les données d’exécution d’expérience MLflow à l’aide du mot-clé personnalisé mlflow-experiment. |
Données non structurées
Formats et types pour stocker et traiter des documents, images, fichiers audio et autres fichiers non structurés.
| Format | Description |
|---|---|
| Travail avec des données non structurées | Stockez, gérez et traitez des données non structurées telles que des documents, des images et des audios. |
| Binaire | Lisez les fichiers sous forme d’enregistrements binaires bruts, y compris des images et d’autres données non structurées. |
| Image | Chargez des données d'image pour les tâches d'apprentissage automatique. Databricks recommande de charger des images sous forme binary de données. |
| FILE | Stocker une référence gouvernée à un fichier non structuré au lieu d’utiliser BINARY ou STRING. |
| Importer des fichiers en tant que type FILE | Importer des fichiers non structurés dans des tables sous forme de références FILE avec SQL, des fonctions à valeurs de table et Auto Loader. |
| Fichiers de processus avec des UDF | Lire des octets de fichiers, extraire des métadonnées d’images et de vidéos, et générer des fichiers dérivés avec des UDF. |
| Démarrage rapide des fonctions FILE | Commencez avec le FILE type et ses fonctions dans Databricks SQL et Databricks Runtime. |
Données semi-structurées
Modèles et fonctions pour travailler avec des données imbriquées et semi-structurées dans le lakehouse.
| Format | Description |
|---|---|
| Modéliser des données semi-structurées | Choisissez entre Variant, chaînes JSON, structs et cartes pour stocker des données semi-structurées. |
| Variant | Stockez des données semi-structurées en utilisant le VARIANT type pour des lectures et écritures optimisées. |
| Transformer des types de données complexes | Travailler avec des structs, des tableaux et des cartes dans Apache Spark. |
| Fonctions d’ordre supérieur | Transformez les tableaux et les mappages en utilisant des fonctions d’ordre supérieur intégrées. |