Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Microsoft Purview prend en charge l’évaluation de la qualité des données sur les ressources de données Apache Iceberg. Vous pouvez organiser, gouverner et analyser les données Iceberg sur ces sources de stockage :
- Azure Data Lake Storage Gen2
- Microsoft Fabric Lakehouse
- Amazon Web Services (AWS) S3
- Google Cloud Platform (GCP) Cloud Storage (GCS)
Cet article explique la structure des fichiers Iceberg, montre comment configurer des analyses de qualité des données et répertorie des conseils pour chaque catalogue et type de stockage.
Structure de fichiers Iceberg
Une table Iceberg est bien plus qu’une simple collection de fichiers de données. Il inclut différents fichiers de métadonnées qui suivent l’état de la table et facilitent les opérations telles que les lectures, les écritures et l’évolution du schéma. Une table Iceberg comprend un catalogue, une couche de métadonnées et une couche de données. Les fichiers de données d’une table Iceberg sont généralement stockés dans des formats en colonnes comme Apache Parquet, Apache Avro ou Apache Optimized Row Columnar (ORC). Ces fichiers contiennent les données réelles avec lesquelles les utilisateurs interagissent pendant les requêtes.
Vue d’ensemble de la couche catalogue
Le catalogue Iceberg se trouve en haut de la hiérarchie. Il stocke le pointeur de métadonnées actuel pour chaque table. Le catalogue permet de suivre l’état le plus récent d’une table en référençant le fichier de métadonnées actuel.
Vue d’ensemble de la couche de métadonnées
La couche de métadonnées est au cœur des fonctionnalités d’Iceberg. Il comprend les éléments clés suivants :
- Fichier de métadonnées : Contient des informations sur le schéma, le partitionnement et les instantanés de la table. Dans le diagramme, s0 fait référence à un instantané, un enregistrement de l’état de la table à un moment donné dans le temps. S’il existe plusieurs instantanés (par exemple, s0 et s1), le fichier de métadonnées effectue le suivi des deux.
- Liste des manifestes : Pointe vers un ou plusieurs fichiers manifeste. Une liste de manifestes agit comme un conteneur de références à ces manifestes. Il permet à Iceberg de gérer les fichiers de données qui doivent être lus ou écrits pendant différentes opérations. Chaque instantané peut avoir sa propre liste de manifestes.
Vue d’ensemble de la couche de données
Dans la couche de données, les fichiers manifestes jouent le rôle d’intermédiaire entre les métadonnées et les fichiers de données réels. Chaque fichier manifeste pointe vers une collection de fichiers de données, fournissant une carte des fichiers physiques stockés dans le lac de données.
- Fichiers manifeste : stockez les métadonnées d’un groupe de fichiers de données, y compris le nombre de lignes, les informations de partition et les chemins d’accès aux fichiers. Ils permettent à Iceberg d’élaguer et d’accéder rapidement à des fichiers spécifiques.
- Fichiers de données : contiennent les données réelles, stockées dans des formats tels que Parquet, ORC ou Avro. Iceberg organise les fichiers de données en fonction des partitions, ce qui réduit les analyses de données inutiles pendant l’exécution des requêtes.
Fonctionnement des composants Iceberg
Lorsque vous interrogez ou mettez à jour des données, Iceberg recherche le fichier de métadonnées de la table via le catalogue. Le fichier de métadonnées fait référence à la instantané actuelle (ou plusieurs instantanés). Chaque instantané pointe vers une liste de manifestes, qui fait référence aux fichiers manifeste. Les fichiers manifeste répertorient les fichiers de données. Cette recherche en couches permet à Iceberg de gérer des jeux de données volumineux tout en conservant la cohérence des lectures et des écritures. Les lecteurs et les rédacteurs voient toujours un état de table cohérent. La conception basée sur instantané permet également un voyage dans le temps (interrogation des états de table antérieurs) et l’évolution du schéma.
La même approche en couches améliore les performances pour les opérations de traitement par lots et de diffusion en continu. Seuls les fichiers de données nécessaires sont lus et les mises à jour utilisent des instantanés sans modifier le jeu de données complet.
Données iceberg dans OneLake
Importante
Les données iceberg dans AWS S3 et GCS doivent également être synchronisées automatiquement en tant que Delta pour organiser, gouverner et mesurer et surveiller la qualité des données.
Vous pouvez consommer en toute transparence des données au format Iceberg dans Microsoft Fabric sans déplacement ou duplication de données. Utilisez les raccourcis OneLake pour pointer directement vers une couche de données.
Les données iceberg sont stockées dans OneLake et écrites à l’aide de Snowflake ou d’un autre enregistreur Iceberg. OneLake virtualise la table en tant que table Delta Lake, ce qui garantit une compatibilité étendue entre les moteurs Fabric. Par exemple, vous pouvez créer un volume dans Snowflake et le pointer directement vers Fabric Lakehouse. Une fois la table Iceberg créée dans OneLake, la synchronisation automatique reflète les mises à jour des données en temps réel. Pour plus d’informations, consultez Configurer un volume externe Iceberg pour Azure dans la documentation Snowflake.
Qualité des données pour les données Iceberg
Pour tous les utilisateurs qui hydratent en mode natif les données dans Iceberg sur Parquet, ORC ou Avro sur Data Lake Storage Gen2 ou Fabric Lakehouse, configurez une analyse pointant vers l’emplacement du répertoire hébergeant les données et les métadonnées des répertoires Iceberg. Pour configurer la prise en charge de la qualité des données Iceberg, procédez comme suit :
- Configurez et exécutez une analyse dans Mappage de données Microsoft Purview.
- Configurez l’annuaire hébergeant les données et les métadonnées en tant que ressource de données et associez-les à un produit de données. L’association du répertoire en tant que ressource de données et sa liaison à un produit de données forme le jeu de données Iceberg. Découvrez comment associer des ressources de données à un produit de données.
- Dans Catalogue unifié, sous Gestion de l’intégrité, sélectionnez Vue qualité des données pour rechercher vos fichiers Iceberg (ressource de données) et configurer la connexion à la source de données.
- Pour configurer une connexion Data Lake Storage Gen2, suivez les étapes décrites dans Configurer une connexion de source de données pour la qualité des données.
- Pour configurer une connexion Fabric OneLake, suivez les étapes décrites dans Configurer la qualité des données fabric Lakehouse.
- Dans la page Schéma du fichier Iceberg sélectionné (ressource de données), sélectionnez Importer le schéma pour importer le schéma à partir de la source de données.
- Dans la page Vue d’ensemble du fichier Iceberg, dans le menu déroulant Ressource de données , sélectionnez Iceberg.
- Appliquez des règles de qualité des données et exécutez des analyses de qualité des données pour le scoring de qualité des données au niveau des colonnes et des tables.
Profilage et analyse de la qualité des données
Importante
Avant d’exécuter le profilage des données ou les analyses de qualité des données, vous devez récupérer et définir le schéma à partir de la page Schéma de qualité des données. Les consommateurs ne voient pas le schéma dans la vue des ressources de données, car Data Map ne prend pas encore en charge le format de table ouverte Iceberg. Les gestionnaires de la qualité des données peuvent importer le schéma à partir de la page Schéma de qualité des données.
Une fois que vous avez terminé la configuration de la connexion et la sélection du format de fichier de ressource de données, vous pouvez profiler vos données, créer et appliquer des règles, et exécuter une analyse de la qualité des données de vos données dans les fichiers au format ouvert Iceberg. Pour obtenir des instructions pas à pas, consultez les articles suivants :
- Configurer et exécuter le profilage des données pour une ressource de données
- Configurer et exécuter une analyse de la qualité des données
Importante
La prise en charge du format ouvert Iceberg dans les fonctionnalités de découverte de catalogue, de curation, de profilage des données et d’analyse de la qualité des données est en préversion.
Limitations actuelles pour la qualité des données Iceberg
La préversion actuelle de Microsoft Purview prend en charge les données créées au format Iceberg avec le catalogue Apache Hadoop (implémentation de catalogue basée sur des fichiers) uniquement. Les scénarios de catalogue Snowflake sont pris en charge uniquement par le biais de la virtualisation Delta à l’aide des raccourcis OneLake.
Chemin lakehouse et chemin Data Lake Storage Gen2
Les métadonnées Iceberg stockent le chemin complet des données et des métadonnées. Veillez à utiliser le chemin d’accès complet pour Data Lake Storage Gen2 et Fabric Lakehouse. En outre, pour le chemin Fabric Lakehouse pendant l’écriture, assurez-vous de fonctionner (WRITE, UPSERTS) avec les chemins d’accès d’ID. L’exemple suivant montre le format de chemin d’accès ABFSS requis. Remplacez et
<lakehouse-ID>par<filesystem-ID>vos GUID réels :abfss://<filesystem-ID>@onelake.dfs.fabric.microsoft.com/<lakehouse-ID>/Files/CustomerDataSystème de fichiers en tant qu’ID et Lakehouse en tant qu’ID. Des chemins d’accès absolus et non relatifs sont nécessaires pour que Microsoft Purview assure la qualité des données sur Iceberg. Pour valider, veillez à case activée le chemin d’accès des captures instantanées pour pointer comme chemins complets de nom de domaine complet (FQN).
Détection de schéma
- Data Map ne peut pas détecter le schéma Iceberg. Lorsque vous organisez les répertoires Iceberg sur Fabric Lakehouse ou Data Lake Storage Gen2, vous ne pouvez pas examiner le schéma. Toutefois, le schéma d’extraction de la qualité des données peut extraire le schéma de la ressource organisée.
Recommandations pour la configuration de la qualité des données Iceberg
Choisissez l’approche qui correspond à votre catalogue et à votre stockage :
| Source/Catalogue | Stockage | Approche | Formats pris en charge |
|---|---|---|---|
| Catalogue Snowflake | Data Lake Storage Gen2, AWS S3 ou GCP GCS (VOLUME) | Utilisez un raccourci Fabric OneLake Table. Exécutez la qualité des données sous la forme d’une table Delta. | Parquet uniquement |
| Catalogue Hadoop | Data Lake Storage Gen2 | Analysez directement le répertoire. Utilisez le moteur Iceberg pour la qualité des données. | Parquet, ORC, Avro |
| Flocon de neige | Fabric Lakehouse (VOLUME pointé vers Lakehouse) | Utilisez OneLake Table pour créer une version compatible avec Delta. | Parquet uniquement |
| Catalogue Hadoop | Fabric Lakehouse | Analysez directement le répertoire Lakehouse. Utilisez le moteur Iceberg pour la qualité des données. | Parquet, ORC, Avro |
Ressources connexes
Ces articles couvrent la configuration et l’analyse de la qualité des données :
- Configurer la connexion à la source de données pour la qualité des données
- Configurer et exécuter le profilage des données pour une ressource de données
- Configurer et exécuter une analyse de la qualité des données
- Configurer la qualité des données pour les sources de données de raccourci Fabric Lakehouse
- Résolution des problèmes sur la qualité des données