Microsoft Purview 統合カタログのデータ品質の概要

Microsoft Purview 統合カタログのデータ品質により、ガバナンス ドメインとデータ所有者は、データ エコシステムの品質を評価および監視し、改善のための的を絞ったアクションを促進します。 今日の AI 主導の環境では、データの信頼性は AI 主導の分析情報と推奨事項の精度に直接影響します。 信頼できるデータがなければ、AI システムへの信頼が損なわれ、その導入が妨げられるリスクがあります。

データ品質が低かったり、互換性のないデータ構造が悪くなったりすると、ビジネス プロセスや意思決定能力が妨げられる可能性があります。 統合カタログのデータ品質は、Out-of-Box (OOB) ルールや AI 生成ルールなど、ノーコードまたはローコードルールを使用してデータ品質を評価する機能をユーザーに提供することで、これらの課題に対処します。 これらのルールは列レベルで適用され、集計されてデータ資産、データ製品、ガバナンス ドメインのレベルでスコアが得られ、各ドメイン内のデータ品質のエンドツーエンドの可視性が確保されます。

Microsoft Purview のデータ品質には、AI を利用したデータ プロファイリング機能も組み込まれており、人間の介入によってこれらの推奨事項を絞り込むことにより、プロファイリング用の列が推奨されます。 この反復プロセスは、データ プロファイリングの精度を向上させるだけでなく、基盤となる AI モデルの継続的な改善にも貢献します。

データ品質を適用することで、組織はデータ資産の品質を効果的に測定、監視、強化し、AI 主導の洞察の信頼性を強化し、AI ベースの意思決定プロセスへの信頼を育むことができます。

データ品質のライフ サイクル

  1. すべてのデータ品質機能を使用するために、統合カタログでユーザーにデータ品質スチュワード権限を割り当てます。
  2. Microsoft Purview データ マップでデータ ソースを登録してスキャンします。
  3. データ アセットをデータ製品に追加する
  4. データ ソース接続を設定して、データ品質評価用にソースを準備します。
  5. データ ソース内の資産のデータ プロファイルを構成して実行します。
    1. プロファイリングが完了したら、データ資産内の各列の結果を参照して、データの現在の構造と状態を把握します。
  6. プロファイリング結果に基づいてデータ品質ルールを設定し、それらをデータ資産に適用します。
  7. データ製品でデータ品質スキャンを構成して実行し、データ製品でサポートされているすべての資産の品質を評価します。
  8. スキャン結果を確認し て、データ製品の現在のデータ品質を評価します。
  9. データ資産のライフ サイクルにわたって定期的に手順 5 - 8 を繰り返して、品質が維持されるようにします。
  10. データ品質を継続的に監視する
    1. データ品質アクションを確認し て、問題を特定して解決します。
    2. データ品質に関する通知を設定して 、品質の問題を警告します。

サポートされるデータ品質リージョン

データ品質は現在、 次のリージョンでサポートされています。

重要

データ品質機能は、アカウントとデータ ソースが Purview でサポートされているリージョンにある場合にのみサポートされます。 データ ソースと purview アカウントが同じ Azure リージョンに存在する必要があります。 DQ ジョブの同時実行制限は次のとおりです。

  • 手動スキャン: 最大 10 個の同時ジョブ。
  • スケジュールされたスキャン: 最大 25 の同時ジョブ。
  • 手動プロファイル: 最大 10 個の同時プロファイル ジョブ。
  • DQ ルールの提案: 最大 10 個の同時ジョブ。

サポートされているマルチクラウド データ ソース

サポートされているデータ ソースの一覧を表示します。

重要

Parquet ファイルのデータ品質は、次のサポートをサポートするように設計されています。

  1. Parquet パーツ ファイルを含むディレクトリ。 例: ./Sales/{Parquet Part Files}。 完全修飾名は https://(storage account).dfs.core.windows.net/(container)/path/path2/{SparkPartitions} の後に続く必要があります。 ディレクトリとサブディレクトリ構造に {n} 個のパターンが含まれていないことを確認してください。 代わりに、{SparkPartitions} につながる直接 FQN を使用します。
  2. パーティション分割された Parquet ファイルを含むディレクトリ。年と月でパーティション分割された売上データなどのデータセット内の列でパーティション分割されます。 例: ./Sales/{Year=2018}/{Month=Dec}/{Parquet Part Files}。

一貫性のある Parquet データセット スキーマを示すこれらの重要なシナリオは両方ともサポートされています。 制限事項: データ品質は、Parquet ファイルを使用してディレクトリの任意の階層をサポートするようには設計されていません。 (1) または (2) 構築された構造でデータを提示することをお勧めします。

現在、Microsoft Purview では、認証オプションとして マネージド ID を使用することによってのみ、データ品質スキャンを実行できます。 Apache Spark 3.5 および Delta Lake 3.2.1 で実行されるデータ品質サービス。

データ品質機能

  • データ ソース接続の構成
    • Microsoft Purview データ品質 SaaS アプリケーションが品質スキャンとプロファイリングのためにデータへの読み取りアクセスを許可するように接続を構成します。
    • Microsoft Purview では、認証オプションとしてマネージド ID が使用されます。
  • データ プロファイリング
    • AI 対応のデータ プロファイリング エクスペリエンス。
    • 業界標準の統計スナップショット(分布、最小、最大、標準偏差、一意性、完全性、重複など)。
    • 列レベルのプロファイリング メジャーをドリルダウンします。
  • データ品質ルール
    • 6つの業界標準データ品質側面(完全性、一貫性、適合性、正確性、鮮度、独自性)を測定するためのすぐに使用できるルール。
    • カスタム ルールの作成機能には、すぐに使用できる関数と式の値の数が含まれます。
    • AI 統合エクスペリエンスを使用した自動生成ルール。
  • データ品質スキャン
    • Data Quality スキャンの列を選択し、ルールを割り当てます。
    • エンティティまたはテーブル レベルでデータの更新ルールを適用して、データの更新の SLA を測定します。
    • 期間 (1 時間、日、週、月など) のデータ品質スキャン ジョブをスケジュールします。
  • データ品質ジョブの監視
    • データ品質ジョブの状態 (アクティブ、完了、失敗など) の監視を有効にします。
    • データ品質スキャン履歴の閲覧を有効にします。
  • データ品質スコアリング
    • ルール レベルのデータ品質スコア (列に適用されたルールの品質スコア)。
    • データ資産、データ製品、およびガバナンス ドメインのデータ品質スコア (1 つのガバナンス ドメインには多数のデータ製品を含めることができ、1 つのデータ製品には多数のデータ資産を含めることができ、1 つのデータ資産には多数のデータ列を含めることができます)。
  • データ品質アラート
    • データ品質しきい値が期待値を下回った場合にデータ所有者とデータスチュワードに通知するようにアラートを構成します。
    • データ品質の問題に関する通知を送信するようにメール エイリアスまたは配布グループを構成します。
  • データ品質アクション
    • データ品質の異常状態に対処するためのアクションを備えたデータ品質のアクション センター。データ品質スチュワードの診断クエリは、各異常状態に対して修正する特定のデータをゼロにします。
  • データ品質マネージド仮想ネットワーク
    • プライベート エンドポイントを使用して Microsoft Azure データ ソースに接続する、データ品質によって管理される仮想ネットワーク。

データ所在地と暗号化

Microsoft マネージド ストレージ アカウントには、データ品質メタデータとプロファイリングの概要が格納されます。 データ ソースと同じリージョンに格納されるため、データ所在地はそのまま残ります。 すべてのデータは暗号化されます。 Purview リソース プロバイダーの地域ユーザー データ ストアは、メタデータに使用されます。 これはすべての暗号化を処理し、すべての Purview サービスで共通です。 カスタマー マネージド暗号化キー (CMK) を使用してデータ暗号化をより細かく制御する場合は、別のプロセスを使用します。 Microsoft Purview カスタマー キーの詳細情報。

データ品質コンピューティング価格

データ品質の使用量は、Data Governance Processing Unit (DGPU) 従量課金制メーターに基づいて課金されます。 データ品質のための価格の計算方法の詳細を確認します。

制限事項

  • 仮想ネットワークは、Google Big Query ではまだサポートされていません。
  • データ品質スキャンには、データ資産ごとに最大 200 個のデータ品質ルールを適用できます。 この制限と回避策に関する詳細をご確認ください。

次の手順

  1. ユーザーがすべてのデータ品質機能を使用できるように、統合カタログでユーザーにデータ品質スチュワード権限を割り当てます。
  2. データ ソース接続 を設定して、データ品質評価用にソースを準備します。
  3. データ ソース内の資産のデータ プロファイルを構成して実行します。