Übersicht über die Datenqualität in Microsoft Purview Unified Catalog

Die Datenqualität in Microsoft Purview Unified Catalog ermöglicht es Besitzern von Governancedomänen und Daten, die Qualität ihres Datenökosystems zu bewerten und zu überwachen, um gezielte Verbesserungsmaßnahmen zu ermöglichen. In der heutigen KI-gesteuerten Landschaft wirkt sich die Zuverlässigkeit der Daten direkt auf die Genauigkeit von KI-gesteuerten Erkenntnissen und Empfehlungen aus. Ohne vertrauenswürdige Daten besteht die Gefahr, dass das Vertrauen in KI-Systeme untergraben und ihre Einführung behindert wird.

Schlechte Datenqualität oder inkompatible Datenstrukturen können Geschäftsprozesse und Entscheidungsfindungsfähigkeiten beeinträchtigen. Die Datenqualität in Unified Catalog bewältigt diese Herausforderungen, indem sie Benutzern die Möglichkeit bietet, die Datenqualität mithilfe von No-Code- oder Low-Code-Regeln zu bewerten, einschließlich Out-of-the-Box-Regeln (OOB) und KI-generierter Regeln. Diese Regeln werden auf Spaltenebene angewendet und aggregiert, um Bewertungen auf der Ebene von Datenressourcen, Datenprodukten und Governancedomänen bereitzustellen, wodurch eine End-to-End-Transparenz der Datenqualität innerhalb jeder Domäne sichergestellt wird.

Datenqualität in Microsoft Purview enthält auch KI-gestützte Datenprofilerstellungsfunktionen, die Spalten für die Profilerstellung empfehlen und gleichzeitig menschliches Eingreifen ermöglichen, um diese Empfehlungen zu verfeinern. Dieser iterative Prozess verbessert nicht nur die Genauigkeit der Datenprofilerstellung, sondern trägt auch zur kontinuierlichen Verbesserung der zugrunde liegenden KI-Modelle bei.

Durch die Anwendung der Datenqualität können Unternehmen die Qualität ihrer Datenbestände effektiv messen, überwachen und verbessern, die Zuverlässigkeit KI-gesteuerter Erkenntnisse stärken und das Vertrauen in KI-basierte Entscheidungsprozesse fördern.

Lebenszyklus der Datenqualität

  1. Weisen Sie Benutzer(n) Data Quality Steward-Berechtigungen in Unified Catalog zu, um alle Datenqualitätsfeatures zu verwenden.
  2. Registrieren und Überprüfen einer Datenquelle in Microsoft Purview Data Map.
  3. Hinzufügen Ihres Datenbestands zu einem Datenprodukt
  4. Richten Sie eine Datenquellenverbindung ein, um Ihre Quelle für die Datenqualitätsbewertung vorzubereiten.
  5. Konfigurieren und führen Sie die Datenprofilerstellung für ein Asset in Ihrer Datenquelle aus.
    1. Wenn die Profilerstellung abgeschlossen ist, durchsuchen Sie die Ergebnisse für jede Spalte im Datenasset, um die aktuelle Struktur und den aktuellen Zustand Ihrer Daten zu verstehen.
  6. Richten Sie auf der Grundlage der Profilerstellungsergebnisse Regeln für die Datenqualität ein, und wenden Sie diese auf Ihr Datenasset an.
  7. Konfigurieren und führen Sie einen Datenqualitätsscan für ein Datenprodukt durch, um die Qualität aller unterstützten Ressourcen im Datenprodukt zu bewerten.
  8. Überprüfen Sie Ihre Überprüfungsergebnisse , um die aktuelle Datenqualität Ihres Datenprodukts zu bewerten.
  9. Wiederholen Sie die Schritte 5 bis 8 regelmäßig über den Lebenszyklus Ihres Datenassets, um sicherzustellen, dass die Qualität erhalten bleibt.
  10. Kontinuierliche Überwachung Ihrer Datenqualität
    1. Überprüfen Sie Datenqualitätsaktionen , um Probleme zu identifizieren und zu beheben.
    2. Legen Sie Benachrichtigungen zur Datenqualität fest , um Sie bei Qualitätsproblemen zu warnen.

Unterstützte Datenqualitätsregionen

Data Quality wird derzeit in den folgenden Regionen unterstützt.

Wichtig

Die Datenqualitätsfunktion wird nur unterstützt, wenn sich die Konten und Datenquellen in Regionen befinden, die Purview unterstützen. Datenquellen und Purview-Konto müssen sich in derselben Azure-Region befinden. Grenzwerte für gleichzeitige Ausführung von DQ-Aufträgen sind:

  • Manuelle Scans: Maximal 10 gleichzeitige Aufträge.
  • Geplante Scans: Maximal 25 gleichzeitige Aufträge.
  • Manuelles Profil: Maximal 10 gleichzeitige Profilerstellungsaufträge.
  • DQ-Regelvorschlag: Maximal 10 gleichzeitige Aufträge.

Unterstützte Multicloud-Datenquellen

Zeigen Sie die Liste der unterstützten Datenquellen an.

Wichtig

Data Quality für Parquet-Dateien unterstützt Folgendes:

  1. Ein Verzeichnis mit Parquet-Part-Datei. Beispiel: ./Sales/{Parquet Part Files}. Der vollqualifizierte Name muss folgen https://(storage account).dfs.core.windows.net/(container)/path/path2/{SparkPartitions}. Stellen Sie sicher, dass die Verzeichnis- und Unterverzeichnisstruktur keine {n}-Muster enthält. Verwenden Sie stattdessen einen direkten FQN, der zu {SparkPartitions} führt.
  2. Ein Verzeichnis mit partitionierten Parquet-Dateien, die nach Spalten innerhalb des Datasets partitioniert sind, z. B. Umsatzdaten, partitioniert nach Jahr und Monat. Beispiel: ./Sales/{Year=2018}/{Month=Dec}/{Parquet Part Files}.

Beide wesentlichen Szenarien, die ein konsistentes Parquet-Datasetschema darstellen, werden unterstützt. Einschränkung: Data Quality ist nicht darauf ausgelegt, beliebige Hierarchien von Verzeichnissen mit Parquet-Dateien zu unterstützen. Es wird empfohlen, Daten in der (1) oder (2) konstruierten Struktur darzustellen.

Derzeit kann Microsoft Purview nur Datenqualitätsüberprüfungen ausführen, indem die verwaltete Identität als Authentifizierungsoption verwendet wird. Datenqualitätsdienste werden auf Apache Spark 3.5 und Delta Lake 3.2.1 ausgeführt.

Features für Datenqualität

  • Konfiguration der Datenquellverbindung
    • Konfigurieren Sie die Verbindung, damit die Microsoft Purview-Data-Quality-SaaS-Anwendung Lesezugriff auf Daten für Qualitätsscans und Profilerstellung erhält.
    • Microsoft Purview verwendet eine verwaltete Identität als Authentifizierungsoption.
  • Datenprofilerstellung
    • KI-gestützte Datenprofilerstellung.
    • Statistische Momentaufnahme nach Industriestandard (Verteilung, Min, Max, Standardabweichung, Eindeutigkeit, Vollständigkeit, Duplikat und mehr).
    • Führen Sie einen Drilldown für Profilerstellungsmaßnahmen auf Spaltenebene aus.
  • Regeln zur Datenqualität
    • Out-of-Box-Regeln zur Messung von sechs Branchenstandards Datenqualitätsdimensionen (Vollständigkeit, Konsistenz, Konformität, Genauigkeit, Aktualität und Einzigartigkeit).
    • Zu den Features zum Erstellen von benutzerdefinierten Regeln gehören eine Reihe von vorkonfigurierten Funktionen und Ausdruckswerten.
    • Automatisch generierte Regeln mit integrierter KI-Erfahrung.
  • Überprüfung mit Datenqualität
    • Wählen Sie Regeln für die Datenqualitätsüberprüfung aus, und weisen Sie sie Spalten zu.
    • Wenden Sie die Datenaktualitätsregel auf Entitäts- oder Tabellenebene an, um das SLA für die Datenfrische zu messen.
    • Planen des Datenqualitätsscanauftrags für einen bestimmten Zeitraum (stündlich, täglich, wöchentlich, monatlich und mehr).
  • Auftragsüberwachung für die Datenqualität
    • Status des Auftrags "Überwachung der Datenqualität" aktivieren (aktiv, abgeschlossen, fehlgeschlagen und mehr).
    • Aktivieren des Durchsuchens des Datenqualitätsscanverlaufs.
  • Bewertung der Datenqualität
    • Datenqualitätsbewertung in Regelebene (wie hoch ist die Qualitätsbewertung für eine Regel, die für eine Spalte angewendet wurde).
    • Datenqualitätsbewertung für Datenressourcen, Datenprodukte und Governancedomänen (eine Governancedomäne kann viele Datenprodukte haben, ein Datenprodukt kann viele Datenressourcen haben, ein Datenobjekt kann viele Datenspalten haben).
  • Warnungen zur Datenqualität
    • Konfigurieren Sie Warnungen, um Datenbesitzer und Datenverwalter zu benachrichtigen, wenn der Schwellenwert für die Datenqualität die Erwartungen verfehlt.
    • Konfigurieren Sie einen E-Mail-Alias oder eine Verteilergruppe, um Benachrichtigungen bei Datenqualitätsproblemen zu senden.
  • Aktionen zur Datenqualität
    • Aktionscenter für Datenqualität mit Aktionen zum Beheben von Datenqualitätsanomaliezuständen, einschließlich Diagnoseabfragen für Data Quality Steward, um sich auf die spezifischen Daten zu konzentrieren, die für jeden Anomaliestatus behoben werden sollen.
  • Verwaltetes virtuelles Netzwerk mit Datenqualität
    • Ein virtuelles Netzwerk, das von Data Quality verwaltet wird und private Endpunkte mit Ihren Microsoft Azure-Datenquellen verbindet.

Datenresidenz und Verschlüsselung

Das Microsoft Managed Storage-Konto speichert Metadaten zur Datenqualität und eine Zusammenfassung der Profilerstellung. Sie speichert sie in derselben Region wie die Datenquelle, sodass die Datenresidenz intakt bleibt. Alle Daten sind verschlüsselt. Der regionale Benutzerdatenspeicher des Purview-Ressourcenanbieters wird für Metadaten verwendet. Es übernimmt die gesamte Verschlüsselung und ist für alle Purview-Dienste gleich. Wenn Sie mehr Kontrolle über Ihre Datenverschlüsselung mit einem kundenseitig verwalteten Verschlüsselungsschlüssel (CMK) wünschen, verwenden Sie einen separaten Prozess. Weitere Informationen zum Microsoft Purview-Kundenschlüssel.

Preise für Data Quality Computing

Die Nutzung der Datenqualität wird auf der Grundlage der Data Governance Processing Unit (DGPU) Pay-as-you-go-Zähler (Data Governance Processing Unit) in Rechnung gestellt. Hier finden Sie Details dazu , wie die Preise für die Datenqualität berechnet werden.

Begrenzungen

Nächste Schritte

  1. Weisen Sie Benutzern Data Quality Steward-Berechtigungen in Unified Catalog zu, damit sie alle Datenqualitätsfeatures nutzen können.
  2. Richten Sie eine Datenquellenverbindung ein , um Ihre Quelle auf eine Datenqualitätsbewertung vorzubereiten.
  3. Konfigurieren und führen Sie die Datenprofilerstellung für ein Asset in Ihrer Datenquelle aus.