Microsoft Purview 统一目录中的数据质量使治理域和数据所有者能够评估和监督其数据生态系统的质量,从而促进有针对性的改进操作。 在当今人工智能驱动的环境中,数据的可靠性直接影响人工智能驱动的见解和建议的准确性。 如果没有可靠的数据,就有可能削弱人们对人工智能系统的信任并阻碍其采用。
数据质量差或数据结构不兼容可能会阻碍业务流程和决策能力。 统一目录 中的数据质量通过让用户能够使用无代码或低代码规则(包括现成的 (OOB) 规则和 AI 生成的规则)来评估数据质量,从而解决了这些挑战。 这些规则在列级别应用并聚合,以提供数据资产、数据产品和管理域级别的分数,确保每个域内数据质量的端到端可见性。
Microsoft Purview 中的数据质量还整合了 AI 支持的数据分析功能,建议要分析的列,同时允许人工干预来优化这些建议。 这种迭代过程不仅提高了数据分析的准确性,还有助于底层人工智能模型的持续改进。
通过应用数据质量,组织可以有效地衡量、监控和提高其数据资产的质量,从而增强人工智能驱动的见解的可靠性,并增强对基于人工智能的决策过程的信心。
数据质量生命周期
- 向用户分配 () 统一目录中的数据质量管理员权限,以使用所有数据质量功能。
- 在 Microsoft Purview 数据映射中注册和扫描数据源。
- 将数据资产添加到数据产品
- 设置数据源连接,为数据质量评估准备源。
-
为数据源中的资产配置并运行数据分析。
- 分析完成后,浏览数据资产中每列的结果,以了解数据的当前结构和状态。
- 根据分析结果设置数据质量规则,并将其应用于您的数据资产。
- 在数据产品上配置并运行数据质量扫描,以评估数据产品中所有受支持资产的质量。
- 查看扫描结果 以评估数据产品的当前数据质量。
- 在数据资产的生命周期中定期重复步骤 5-8,以确保其保持质量。
- 持续监视数据质量
支持的数据质量区域
以下区域当前支持数据质量。
重要
仅当帐户和数据源位于 Purview 支持的区域时,才支持数据质量功能。 数据源和 Purview 帐户需要位于同一 Azure 区域中。 并发 DQ 作业执行限制为:
- 手动扫描:最多 10 个并发作业。
- 计划扫描:最多 25 个并发作业。
- 手动配置文件:最多 10 个并发分析作业。
- DQ 规则建议:最多 10 个并发作业。
支持的多云数据源
查看 支持的数据源列表。
重要
Parquet 文件的数据质量旨在支持:
- 包含 Parquet Part 文件的目录。 例如:./Sales/{Parquet Part Files}。 完全限定的名称必须紧跟。
https://(storage account).dfs.core.windows.net/(container)/path/path2/{SparkPartitions}确保目录和子目录结构不包含 {n} 模式。 相反,使用指向 {SparkPartitions} 的直接 FQN。 - 包含分区的 Parquet 文件的目录,该文件按数据集中的列进行分区,例如按年月分区的销售数据。 例如:./Sales/{Year=2018}/{Month=Dec}/{Parquet Part Files}。
这两种基本方案都受支持,它们提供了一致的 Parquet 数据集架构。 限制: 数据质量并非设计为支持包含 Parquet 文件的任意目录层次结构。 我们建议在 (1) 或 (2) 构造结构中呈现数据。
目前,Microsoft Purview 只能使用 托管标识 作为身份验证选项来运行数据质量扫描。 数据质量服务在 Apache Spark 3.5 和 Delta Lake 3.2.1 上运行。
数据质量功能
-
数据源连接配置
- 配置连接以允许 Microsoft Purview 数据质量 SaaS 应用程序对数据具有读取访问权限,以进行质量扫描和分析。
- Microsoft Purview 使用托管标识作为身份验证选项。
-
数据分析
- 支持 AI 的数据分析体验。
- 行业标准统计快照 (分布、最小值、最大值、标准差、唯一性、完整性、重复等) 。
- 向下钻取列级别分析度量值。
-
数据质量规则
- 用于衡量六个行业标准数据质量维度的开箱即用规则, (完整性、一致性、一致性、准确性、新鲜度和唯一性) 。
- 自定义规则创建功能包括现成函数数和表达式值。
- 具有 AI 集成体验的自动生成规则。
-
数据质量扫描
- 选择规则并将其分配给数据质量扫描的列。
- 在实体或表级别应用数据新鲜度规则来衡量数据新鲜度 SLA。
- (每小时、每天、每周、每月等时间段) 安排数据质量扫描作业。
-
数据质量作业监视
- 启用监控数据质量作业状态 (活动、已完成、失败等) 。
- 启用浏览数据质量扫描历史记录。
-
数据质量评分
- 规则级别的数据质量评分 (应用于列) 的规则的质量评分是多少。
- 数据资产、数据产品和管理域的数据质量分数 (一个治理域可以有多个数据产品,一个数据产品可以有多个数据资产,一个数据资产可以有多个数据列) 。
-
数据质量警报
- 配置警报,以便在数据质量阈值未达到预期时通知数据所有者和数据管理员。
- 配置电子邮件别名或通讯组以发送有关数据质量问题的通知。
-
数据质量操作
- 数据质量操作中心,用于解决数据质量异常状态的操作,包括数据质量管理员的诊断查询,以针对每个异常状态归零要修复的特定数据。
-
数据质量托管虚拟网络
- 由数据质量管理的虚拟网络,与专用终结点连接到 Microsoft Azure 数据源。
数据驻留和加密
Microsoft 托管存储帐户存储数据质量元数据和分析摘要。 它将它们存储在与数据源相同的区域中,因此数据驻留保持不变。 所有数据均已加密。 Purview 资源提供程序区域用户数据存储用于元数据。 它处理所有加密,并且在所有 Purview 服务中都是通用的。 如果希望使用客户管理的加密密钥 (CMK) 更好地控制数据加密,请使用单独的过程。 详细了解 Microsoft Purview 客户密钥。
数据质量计算定价
数据质量使用根据数据治理处理单元 (DGPU) 按量付费计费。 查找 有关如何计算数据质量定价的详细信息。
限制
- Google Big Query 尚不支持虚拟网络。
- 对于数据质量扫描,每个数据资产最多可以应用 200 个数据质量规则。 获取 有关此限制和解决方法的详细信息。
相关内容
- Fabric 数据资产的数据质量
- Fabric 镜像数据源的数据质量
- Fabric 快捷方式数据源的数据质量
- Azure Synapse 无服务器和数据仓库的数据质量
- Azure Databricks Unity Catalog 的数据质量
- Snowflake 数据源的数据质量
- Google BigQuery 的数据质量
- 对 Iceberg 数据的数据质量本机支持
- 本地数据源的数据质量 (预览)
后续步骤
- 在统一目录中为用户分配数据质量管理员权限,以便他们可以使用所有数据质量功能。
- 设置数据源连接 ,为数据质量评估准备源。
- 为数据源中的资产配置并运行数据分析。