Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
La qualité des données dans le Catalogue unifié Microsoft Purview permet aux propriétaires de domaines de gouvernance et de données d’évaluer et de superviser la qualité de leur écosystème de données, facilitant ainsi des actions ciblées pour l’amélioration. Dans le paysage actuel axé sur l’IA, la fiabilité des données a un impact direct sur la précision des informations et des recommandations basées sur l’IA. Sans données fiables, il existe un risque d’éroder la confiance dans les systèmes d’IA et d’entraver leur adoption.
Une mauvaise qualité des données ou des structures de données incompatibles peuvent entraver les processus métier et les capacités de prise de décision. La qualité des données dans le catalogue unifié répond à ces défis en offrant aux utilisateurs la possibilité d’évaluer la qualité des données à l’aide de règles no-code ou low-code, y compris des règles prêtes à l’emploi (OOB) et des règles générées par l’IA. Ces règles sont appliquées au niveau des colonnes et agrégées pour fournir des scores aux niveaux des ressources de données, des produits de données et des domaines de gouvernance, garantissant ainsi une visibilité de bout en bout de la qualité des données au sein de chaque domaine.
La qualité des données dans Microsoft Purview intègre également des fonctionnalités de profilage de données basées sur l’IA, en recommandant des colonnes pour le profilage tout en permettant une intervention humaine pour affiner ces recommandations. Ce processus itératif améliore non seulement la précision du profilage des données, mais contribue également à l’amélioration continue des modèles d’IA sous-jacents.
En appliquant la qualité des données, les organisations peuvent mesurer, surveiller et améliorer efficacement la qualité de leurs actifs de données, renforçant ainsi la fiabilité des informations basées sur l’IA et favorisant la confiance dans les processus de prise de décision basés sur l’IA.
Cycle de vie de la qualité des données
- Attribuez aux utilisateurs des autorisations de gestion de la qualité des données dans le catalogue unifié pour utiliser toutes les fonctionnalités de qualité des données.
- Enregistrez et analysez une source de données dans Mappage de données Microsoft Purview.
- Ajouter votre ressource de données à un produit de données
- Configurez une connexion de source de données pour préparer votre source à l’évaluation de la qualité des données.
-
Configurez et exécutez le profilage des données pour une ressource dans votre source de données.
- Une fois le profilage terminé, parcourez les résultats de chaque colonne de la ressource de données pour comprendre la structure et l’état actuels de vos données.
- Configurez des règles de qualité des données basées sur les résultats du profilage et appliquez-les à votre ressource de données.
- Configurez et exécutez une analyse de la qualité des données sur un produit de données afin d’évaluer la qualité de toutes les ressources prises en charge dans le produit de données.
- Passez en revue les résultats de l’analyse pour évaluer la qualité actuelle des données de votre produit de données.
- Répétez régulièrement les étapes 5 à 8 tout au long du cycle de vie de votre ressource de données pour vous assurer que sa qualité est maintenue.
- Surveillez en permanence la qualité de vos données
- Examiner les actions relatives à la qualité des données pour identifier et résoudre les problèmes.
- Définissez des notifications de qualité des données pour vous avertir des problèmes de qualité.
Régions de qualité des données prises en charge
La qualité des données est actuellement prise en charge dans les régions suivantes.
Importante
La fonctionnalité de qualité des données est prise en charge uniquement lorsque les comptes et les sources de données se trouvent dans les régions prises en charge par Purview. Les sources de données et le compte de portée doivent se trouver dans la même région Azure. Les limites d’exécution simultanées de tâches DQ sont les suivantes :
- Scans manuels : Max 10 tâches simultanées.
- Analyses planifiées : 25 tâches simultanées max.
- Profil manuel : Max 10 tâches de profilage simultanées.
- Suggestion de la règle DQ : Max 10 tâches simultanées.
Sources de données multicloud prises en charge
Consultez la liste des sources de données prises en charge.
Importante
La qualité des données des fichiers Parquet est conçue pour prendre en charge :
- Répertoire avec le fichier pièce Parquet. Par exemple : ./Sales/{Parquet Part Files}. Le nom complet doit suivre
https://(storage account).dfs.core.windows.net/(container)/path/path2/{SparkPartitions}. Assurez-vous que la structure des répertoires et des sous-répertoires n’inclut pas {n} modèles. Utilisez plutôt un FQN direct menant à {SparkPartitions}. - Répertoire avec des fichiers Parquet partitionnés, partitionnés par colonnes dans le jeu de données, comme des données de vente partitionnées par année et par mois. Par exemple : ./Sales/{Year=2018}/{Month=Dec}/{Parquet Part Files}.
Ces deux scénarios essentiels, qui présentent un schéma de jeu de données Parquet cohérent, sont pris en charge. Limitation : La qualité des données n’est pas conçue pour prendre en charge les hiérarchies arbitraires de répertoires avec des fichiers Parquet. Nous vous recommandons de présenter les données dans la structure (1) ou (2) construite.
Actuellement, Microsoft Purview peut uniquement exécuter des analyses de qualité des données à l’aide de l’identité gérée comme option d’authentification. Les services de qualité des données s’exécutent sur Apache Spark 3.5 et Delta Lake 3.2.1.
Fonctionnalités de qualité des données
-
Configuration de la connexion à la source de données
- Configurez la connexion pour permettre à l’application SaaS de qualité de données Microsoft Purview d’avoir un accès en lecture aux données pour une analyse et un profilage de qualité.
- Microsoft Purview utilise l’identité managée comme option d’authentification.
-
Profilage des données
- Expérience de profilage de données basée sur l’IA.
- Capture instantanée statistique standard du secteur (distribution, min, max, écart type, unicité, exhaustivité, doublon, etc.).
- Descendre dans la hiérarchie des mesures de profilage au niveau des colonnes.
-
Règles sur la qualité des données
- Règles prêtes à l’emploi pour mesurer six dimensions de qualité des données standard de l’industrie (exhaustivité, cohérence, conformité, exactitude, actualisation et unicité).
- Les fonctionnalités de création de règles personnalisées incluent un certain nombre de fonctions prêtes à l’emploi et de valeurs d’expression.
- Règles générées automatiquement avec une expérience intégrée à l’IA.
-
Analyse de la qualité des données
- Sélectionnez et attribuez des règles aux colonnes pour l’analyse de la qualité des données.
- Appliquez une règle d’actualisation des données au niveau de l’entité ou de la table pour mesurer le SLA d’actualisation des données.
- Planification d’une tâche d’analyse de la qualité des données pour une période (toutes les heures, tous les jours, toutes les semaines, tous les mois, etc.).
-
Surveillance des tâches de qualité des données
- Activer la surveillance du status du travail de qualité des données (actif, terminé, échec, etc.).
- Activez la navigation dans l’historique d’analyse de la qualité des données.
-
Notation de la qualité des données
- Niveau de qualité des données au niveau de la règle (quel est le score de qualité d’une règle appliquée à une colonne).
- Score de qualité des données pour les ressources de données, les produits de données et les domaines de gouvernance (un domaine de gouvernance peut avoir de nombreux produits de données, un produit de données peut avoir de nombreuses ressources de données, une ressource de données peut avoir de nombreuses colonnes de données).
-
Alertes relatives à la qualité des données
- Configurez des alertes pour avertir les propriétaires et les gestionnaires de données si le seuil de qualité des données n’a pas répondu aux attentes.
- Configurez l’alias de messagerie ou le groupe de distribution pour envoyer la notification sur les problèmes de qualité des données.
-
Actions sur la qualité des données
- Centre d’actions pour la qualité des données avec des actions pour traiter les états d’anomalie de qualité des données, y compris des requêtes de diagnostic pour que l’intendant de la qualité des données se concentre sur les données spécifiques à corriger pour chaque état d’anomalie.
-
Réseau virtuel de la qualité des données managé
- Un réseau virtuel géré par la qualité des données qui se connecte avec des points de terminaison privés à vos sources de données Microsoft Azure.
Résidence et chiffrement des données
Le compte de stockage géré Microsoft stocke les données, la qualité, les métadonnées et le résumé du profilage. Il les stocke dans la même région que la source de données, de sorte que la résidence des données reste intacte. Toutes les données sont chiffrées. Le magasin de données utilisateur régional du fournisseur de ressources Purview est utilisé pour les métadonnées. Il gère tout le chiffrement et est commun à tous les services Purview. Si vous souhaitez mieux contrôler votre chiffrement de données avec une clé de chiffrement gérée par le client (CMK), utilisez un processus distinct. En savoir plus sur la clé client Microsoft Purview.
Tarification du calcul de la qualité des données
L’utilisation de la qualité des données est facturée sur la base des compteurs de paiement à l’utilisation de l’unité de traitement de la gouvernance des données (DGPU). Trouvez des informations sur le calcul de la tarification de la qualité des données.
Limitations
- Le réseau virtuel n’est pas encore pris en charge pour Google Big Query.
- Vous pouvez appliquer un maximum de 200 règles de qualité des données par ressource de données pour une analyse de la qualité des données. Obtenez des détails sur cette limite et les solutions de contournement.
Contenu connexe
- Qualité des données pour le parc de données Fabric
- Qualité des données des sources de données en miroir Fabric
- Qualité des données des sources de données de raccourci Fabric
- Qualité des données pour les entrepôts de données et sans serveur Azure Synapse
- Qualité des données pour le catalogue Unity Databricks d’Azure
- Qualité des données pour les sources de données Snowflake
- Qualité des données pour Google BigQuery
- Qualité des données Support natif pour les données Iceberg
- Qualité des données pour les sources de données locales (préversion)
Étapes suivantes
- Attribuez aux utilisateurs des autorisations de responsable de la qualité des données dans le catalogue unifié afin qu’ils puissent utiliser toutes les fonctionnalités de qualité des données.
- Configurez une connexion de source de données pour préparer votre source à une évaluation de la qualité des données.
- Configurez et exécutez le profilage des données pour une ressource dans votre source de données.