Microsoft OneLake 模式与基础功能

本文介绍了常见的 OneLake 模式及其实现平台功能。 利用本文中的信息来思考你想如何组织数据环境,然后选择适合你业务、技术和治理需求的模式。

每个模式描述了如何组织数据和所有权以实现特定的架构目标。 要实现模式,你需要结合一个或多个 OneLake的基础功能 ——数据虚拟化、开放数据互操作性、集中治理以及集成分析和人工智能。 每个功能又依赖于特定的 产品特性 ,如快捷方式、镜像、OneLake 安全性和 Direct Lake 模式。 相同的功能和特性通常出现在多个模式中。

注释

本文基于 OneLake架构指导白皮书中识别的模式。

把这五个图案当作你OneLake设计的基石。 大多数环境都结合了不止一种。 选择与你目标相匹配的图案:

以最少复制实现统一数据访问

如果你的数据分布在多个云、本地系统或外部湖中,将所有数据复制到一个地方可能不现实,甚至可能无法实现。 统一的数据访问与最小复制模式将 OneLake 视为跨源的单一逻辑数据层。 与其为每个数据源构建数据摄取管道,不如使用快捷方式原地引用数据;而在需要已同步且针对查询优化的副本时,则使用镜像。

在以下情况下使用此模式:

  • 您的数据分布在多个云端、本地系统或外部湖泊中。
  • 将数据复制到中央存储会带来过高的存储、延迟或合规开销。
  • 你需要快速导入新源,而不是编写完整的提取、转换、加载(ETL)流程。
  • 你希望保护在现有数据湖、数据仓库和操作型数据存储上的既有投资。

应用统一数据访问

为了实践这一模式,可以从两种主要的数据访问方式开始,这些方法不需要你构建或操作数据移动流程: 虚拟化 使源数据通过OneLake而不必复制,零 ETL镜像 则将平台管理的同步副本以分析准备的Delta表的形式带入OneLake。 只有当这些方法不支持源代码或不符合你的需求时,才使用Fabric数据移动工具。 有关如何选择和组合这些方法的更多指导,请参阅 使用 OneLake 快捷方式和镜像统一数据

  1. 盘点你的数据源,确定 OneLake 可以通过虚拟化或零 ETL 镜像访问哪些数据源:云对象存储、外部目录、运营数据库和 Dataverse。 将其余所有源标记为需要采用数据移动方案。

  2. 为每个支持的来源选择合适的数据访问技术。 当源代码支持无复制访问时,优先选择虚拟化。 当源需要同步且查询优化的副本时,使用零ETL镜像:

源数据 如何访问 数据处理
云对象存储(Azure Data Lake Storage Gen2、Amazon S3、Google Cloud Storage)以及兼容 S3 的本地存储 快捷方式 虚拟化:使源数据可用而无需复制
在外部目录中管理且你希望无需复制即可提供使用的数据(例如,Azure Databricks Unity Catalog) 元数据镜像 ——仅同步目录元数据(模式、表),并通过快捷方式访问源数据 虚拟化:使源数据可用而无需复制
需要查询优化副本的运营数据库(Azure SQL 数据库、Azure Cosmos DB、Snowflake、PostgreSQL、SQL Server 2025、Oracle Database、Google BigQuery) 数据库镜像,或对支持的定制和合作伙伴解决方案的开放镜像 Zero-ETL 镜像:创建同步的Delta副本
Dataverse(Dynamics 365 和 Power Platform 的数据) 快捷方式链接到 Microsoft Fabric以实现零复制访问 虚拟化:使源数据可用而无需复制
  1. 需要时转换源数据。 快捷方式转换可以处理通过快捷方式提供访问的受支持文件,无论这些文件存储在外部,还是已经位于 OneLake 中。 使用 快捷方式文件转换 将结构化文件转换为Delta表,或使用 快捷方式AI转换 处理非结构化文本。 快捷方式变换生成变换后的Delta输出,并保持与快捷方式引用的数据同步。

  2. 当虚拟化和镜像不支持源代码,或者需要复杂的转换、编排、定时移动节奏或流式摄取时,可以使用 Fabric 数据移动工具。 如需在管道、数据流、复制作业和事件流中做出选择,请参见 “选择数据移动策略”。

选择数据移动时,将复制的数据以开放表格格式发布,如 三角洲帕奎特冰山。 镜像和快捷方式变换已经会产生Delta输出。 使用开放格式可以让虚拟化数据、同步副本和转换后的Delta输出能够被Fabric引擎和外部平台读取。

  1. 每当你创建同步副本、转换后的Delta输出或通过Fabric数据移动工具复制时,请记录原因。 此记录使决策可审计。 仅当源数据需要物理的查询优化布局,或者无法通过虚拟方式满足你对新鲜度、转换成本、合规性或处理的要求时,才创建副本。

  2. 对通过OneLake提供的数据应用 OneLake安全 措施,使相同的策略涵盖虚拟化数据、同步副本和转换后的Delta输出。

  3. OneLake 目录中为相应的数据项添加背书和说明,以便数据使用者能够找到并信任这些数据项。

统一的数据访问能力

  • 数据虚拟化零ETL镜像 ——通过无复制引用或同步、分析准备的副本,暴露存在于其他系统和云中的数据。 特征:
  • 集中治理 ——对虚拟化源应用一致的安全和发现,就像对待原生OneLake数据一样。 特征:
  • 开放数据互操作性——确保虚拟化数据和由平台管理的副本可被 Fabric 引擎和外部平台读取。 特征:

奖章架构(铜牌、银牌、金牌)

在OneLake中公开数据只是第一步。 源系统的原始数据通常不安全,不能直接用于分析或人工智能。 它经常包含重复、错误、格式不一致或敏感字段。 当多个团队基于同一源数据构建时,他们需要对每个数据阶段的数据可信度有共同的定义。

勋章架构模式将 OneLake 中的数据组织为三个质量层级:青铜层用于原始且不可变的源数据;白银层用于已清洗并统一规范的数据;黄金层用于经认证、可供业务使用的表和语义模型。 每一层都是明确的阶段,下游消费者可以依赖。 银表和金表可在BI、分析和AI工作负载中重复使用,团队无需在不同工具中重建相同的清洗或建模逻辑。

在以下情况下使用此模式:

  • 多个团队基于相同的源数据构建,需要稳定的质量。
  • 你需要从原始输入到认证输出的可追溯血统。
  • 你需要数据工程与分析或人工智能消费者之间有明确的合同。

有关此模式的详细信息,请参阅了解适用于 OneLake 的 Fabric 奖章架构。 该文章涵盖了层设计、部署模型、存储格式、实体化湖视图和三角表优化。

如何应用

一个有效的奖章核心理念是:每一层都是与下游消费者的合同,数据只有达到该层的质量标准后才会进入下一层。

  1. 识别你的原始数据来源以及依赖认证数据的消费者。

  2. 定义每个层的定义,并在不同领域保持一致地应用这些定义:

    内容 典型消费者
    青铜 原始、不可变的数据直接从源头捕获,无需模式强制 数据工程师(有限访问权限)
    清理、去重,并符合共享的业务定义 数据工程师与受过培训的分析师
    策划的、面向业务的表格和语义模型 所有BI、分析和AI消费者
  3. 使用合适的 Fabric 工作负载构建每一层——通常对铜层和银层使用 Data Engineering(Spark)或 Data Factory,对金层使用 Data Warehouse 或 Power BI 语义模型。 通过使用原始格式、快捷方式获取源数据、Parquet或Delta,以保持青铜版的源忠实度。 对银层和金层使用 Delta 表,以便 Fabric 工作负载能够可靠地读取和写入精炼后的数据。

  4. 应用层级感知访问策略。 对于受支持的项,使用 OneLake 安全性;对于仓库,则使用相应的 Fabric 和 SQL 权限。 限制对青铜的获取,向分析师开放白银,并根据消费者需求和最低特权标准授予黄金。

  5. 使用精选的金币输出进行下游分析。 在直接湖模式下构建金层语义模型,这样Power BI就能读取OneLake数据,而无需创建导入副本或需要计划刷新。

  6. 确认每一种黄金产出都有可追溯的白银血脉,源自青铜。 然后,在 OneLake 目录中将金层表和语义模型标记为已认证。 这种验证帮助消费者识别哪些数据已准备好用于生产环境。

  7. 复用黄金标准语义模型,快速启动Fabric IQ 本体。 这一步为AI代理提供了基于认证数据的受控业务背景。

基础功能

  • 集成式分析和 AI —— 铜层、银层和金层可为 OneLake 中的所有分析和 AI 工作负载提供数据,无需创建特定于引擎的副本。 特征:
  • 集中式治理 ——在每个层级应用不同的访问策略和质量门,使消费者只看到与其角色相符的数据。 特征:
  • 开放数据互操作性——将图层以开放格式存储,以便外部引擎能与 Fabric 一起读取。 特征:

共享平台上的面向域数据网格

如果你有多个业务团队,所有请求都通过一个中央数据团队进行分发可能会减慢传输速度。 业务团队通常最了解自己的数据和需求,但没有共享治理的分散所有权可能导致安全性、质量和血统不一致。

面向域的数据网格模式赋予每个企业域对其数据产品的所有权,而所有域则遵循基于OneLake的共享标准。 每个领域都会发布自己的数据产品,其他领域则通过快捷方式访问这些数据产品,并使用 Fabric 分析和 AI 工作负载来使用它们。 集中式身份、安全和治理策略在所有领域均一适用。

在以下情况下使用此模式:

  • 单一的中央数据团队成为交付的瓶颈。
  • 不同的业务领域有不同的数据、需求和发布节奏。
  • 你需要在域层面对数据质量进行明确问责,同时不放弃企业级的治理。

应用面向域的数据网格

找到去中心化与一致性之间的平衡。 将所有权推向最了解数据的域名,同时保持身份、安全和血统集中,使每个域名的数据产品都符合统一标准。

  1. 确定你的业务领域。 每个领域应代表业务中的一个连贯领域,并配备一个能够端到端拥有和运营其数据产品的团队。

  2. 为每个业务领域创建一个 ,并为其分配工作区。 建立一个独立的中央域用于共享基础设施和可复用的企业数据。

  3. 定义每个领域必须满足的数据产品标准——例如背书或认证要求、文档化的模式、所有权元数据、版本控制和服务水平协议(SLA)。 这些标准使每个产品成为可复用、可发现的契约,而不仅仅是工作区文件夹。

  4. 利用 OneLake 安全 功能在文件夹、表、行和列层面应用基于角色的数据访问控制,使生产者能够发布数据产品而无需暴露工作区中的所有内容。

  5. 通过 OneLake 目录实施整个租户范围的治理,以实现跨域发现和数据沿袭,并使用 Microsoft Purview 实现敏感度标签和审计。 将相同的身份和策略模型扩展到使用域名数据产品的AI代理,使代理访问像其他消费者一样被管理。

  6. 让消费者领域使用 捷径 来引用生产者的数据产品,而不是复制。 消费者随后可以在符合需求的 Fabric 工作负载中使用引用的数据产品。 对于 Power BI 语义模型,可以使用 Direct Lake 模式直接从 OneLake 读取数据。 使用Fabric数据代理Fabric IQ来创建基于受管控领域数据产品的AI体验。

  7. 如果域名发布到Fabric外的目录,请规划访问控制同步,以确保OneLake与外部目录之间的权限保持一致。

    Tip

    Microsoft的开源加速器Policy Weaver可以自动化Azure Databricks(Unity Catalog)、Snowflake和Dataverse源的同步。 它将数据访问策略映射到 OneLake 安全角色中,作为对镜像功能的补充(该功能会移动数据,但不会移动权限)。

数据网格功能

  • 集中治理 ——将所有权下放到域名,同时保持身份、安全和血脉的集中管理。 特征:
  • 数据虚拟化 ——让消费者领域通过引用而非复制品使用生产者拥有的数据产品。 特征:
  • 集成分析与人工智能——让每个领域的数据产品在 Fabric 工作负载中都能使用。 特征:

分析与人工智能平台整合

如果你同时运行多个分析平台——分别用于数据仓库、商业智能、数据科学、实时分析和人工智能的工具——每个工具都配有自己的数据副本、流水线和治理模型。 这种碎片化推高了成本,也使得应用一致的安全措施或获得业务问题的单一答案变得困难。

平台整合模式将这些工作负载带到了 Fabric,OneLake 提供了共享且受管控的数据基础。 Fabric工作负载通过这一基础访问、转换、同步或分析数据,而非依赖每个工具单独的数据和治理模型。

在以下情况下使用此模式:

  • 你正在使用多个功能重叠的分析平台。
  • 特定于引擎的数据副本和数据管道会导致成本上升并增加维护开销。
  • 你需要在所有分析和人工智能工作负载中建立统一的治理和安全模型。

实施平台整合

目标是减少平台,而不是更多集成。 将工作负载整合到 Fabric 中,而不是把多个工具拼接在一起;只有在暂时还无法淘汰外部引擎时,才桥接这些外部引擎。

  1. 盘点您今天使用的分析、数据仓库、数据科学、商业智能(BI)和人工智能工具及管道。 注意每个工具服务的工作负载以及它复制了哪些数据。

  2. 将每个现有工作负载映射到可以替代它的 Fabric 工作负载:

    遗留工作量 Fabric工作负载
    数据编排和ETL 数据工厂
    Spark 笔记本与湖仓处理 数据工程
    SQL 数据仓库 数据仓库
    流媒体与KQL分析 实时智能
    机器学习模型训练与实验跟踪 数据科学
    运营数据库 数据库(Fabric中的SQL数据库和Fabric中的Cosmos数据库)
    BI可视化与语义模型 Power BI 的 Direct Lake 模式
    基于企业数据的对话式人工智能 Fabric 数据代理Copilot for FabricFabric IQ
  3. 利用 OneLake 安全Microsoft PurviewOneLake 目录,在所有工作负载中建立统一的治理和安全模型。 当支持的 Fabric 项目需要另一层加密时,配置客户管理密钥

  4. 通过使用 Delta 或 Iceberg 格式整合 OneLake 中的分析数据,使工作负载共享一个受控的数据基础。 通过将运营工作负载整合到Fabric Databases中,将其纳入其中,并使同步的分析数据可在 OneLake 中使用。

  5. 让 AI 以整合后的数据为基础。 在你策划的数据层上构建本体(预览),并通过 Ontology MCP 服务器向代理开放,这样 Fabric Data Agents、智能 Microsoft 365 Copilot 副驾驶® 和外部工具就能在相同的治理上下文下进行推理。 你可以从处于 Import、Direct Lake 或 DirectQuery 模式的 Power BI 语义模型中生成本体定义。 当你需要为受支持的 OneLake 数据生成绑定时,请使用 Direct Lake 模式,并查看当前本体的限制。

  6. 对于暂时还无法停用的外部引擎,可以通过Azure Databricks 集成与 Snowflake 的 Iceberg 互操作性OneLake 访问与 API使其能够访问 OneLake 数据。

  7. 在验证 Fabric 中的对应方案后,停用已被替换的工具、数据副本和管道。 这样一来,整合带来的是减少成本、许可证和交接环节,而不是在现有平台堆中再叠加一个平台。

平台整合能力

组织间的外部数据共享

如果您与合作伙伴、供应商、客户或其他部门持续交换数据,批处理导出、文件传输和重复下游系统会增加延迟、成本和治理差距。 外部数据共享模式使组织或业务部门外的消费者能够直接访问经过策划的OneLake数据,而无需重复导出。 使用者可以通过 Fabric 跨租户共享访问数据,也可以借助 OneLake 互操作性功能,从 Snowflake 和 Azure Databricks 等外部分析平台访问数据。

你发布更新时,消费者就能看到更新内容。 你通过支持消费者平台的共享或互操作机制来控制对源数据的访问。

在以下情况下使用此模式:

  • 你会持续与外部组织交换数据。
  • 批量导出或文件传输会增加延迟、复杂性或治理漏洞。
  • 你需要集中跟踪并撤销外部访问权限。

应用外部数据共享

外部共享在使用虚拟化而不是导出数据时效果最佳。 将访问方法与每个消费者能读取的内容匹配,并应用该共享或互操作机制支持的访问控制。

  1. 确定你希望与外部共享的数据产品以及需要它们的消费者(合作伙伴、供应商、客户)。 通常,你会分享经过精心策划且有文档说明的表格和文件。

  2. 为每位消费者选择合适的分享方式:

    消费类型 建议的方法
    另一个租户中的 Fabric 用户 用于只读、虚拟化跨租户访问的外部数据共享
    Azure 用户中的 Snowflake Iceberg 与 Snowflake 的互操作性,用于读取以 Iceberg 格式暴露的 Fabric 表格
    Azure Databricks 用户 Azure Databricks 中的 OneLake catalog federation 用于通过 Unity Catalog 查询 OneLake 表而无需复制数据
    支持 ADLS Gen2 或 Blob API 的应用程序或工具 OneLake 访问和 API:通过受支持的 API 访问 OneLake 数据

    要在共享Dataverse数据前导入OneLake,请使用 统一的数据访问模式

  3. 根据所选共享机制支持的权限,限定外部访问的范围。 对于 Fabric 外部数据共享,该共享将向受邀用户主租户中的任何用户授予只读访问权限。 提供商端的安全与治理政策,包括OneLake安全、敏感标签和数据丢失预防策略,并未在消费者租户中执行。 消费者必须管理其环境中的下游接入。

  4. 事先就每个共享关系的条款达成一致——分享什么内容、与谁共享以及持续多久。 对于 Fabric 外部数据共享,请在“管理权限”页面的外部数据共享标签中撤销访问权限。 对于其他方法,可以通过所选共享机制撤销访问权限。 确认消费者失去了可见性。

  5. 在提供商的 Fabric 环境中使用 Microsoft Purview 应用敏感性标签、审计和数据丢失防护。

  6. OneLake目录 中背书并记录源数据产品,以便服务提供者在分享前找到并管理这些产品。 OneLake 目录不会将数据产品发布给外部租户或分析平台。

外部数据共享能力

  • 数据虚拟化 ——通过无复制引用共享数据,无需管理导出管道。 特征:
    • 外部数据共享提供了 Fabric 租户之间的虚拟共享。
    • 捷径 让合作伙伴能够在不复制的情况下消费已发布的数据。
  • 开放数据互操作性——通过以开放格式发布,与不使用 Fabric 的消费者分享。 特征:
  • 集中治理——在 Fabric 中管理源数据,并通过每个共享机制控制外部访问。 特征:
    • OneLake 的安全范围涵盖了对 Fabric 中源数据的访问范围。
    • Microsoft Purview 在提供商的 Fabric 环境中应用敏感性标签、审计和数据丢失预防。
    • OneLake 目录 支持在共享之前进行提供程序端的发现和认证。