本文介紹常見的 OneLake 模式及可用來實作的平台功能。 利用本文資訊思考你想如何組織資料環境,然後選擇符合你業務、技術與治理需求的模式。
每個模式描述如何組織資料與所有權,以達成特定的架構目標。 要實作一個模式,你需要結合一項或多項 OneLake 的基本功能 ——資料虛擬化、開放資料互通性、集中治理,以及整合分析與人工智慧。 每個功能又依賴特定 產品功能 ,如捷徑、鏡像、OneLake 安全性及 Direct Lake 模式。 相同的功能與特性常常出現在多個模式中。
Note
本文基於 OneLake 建築指導白皮書中識別的模式。
請將這五個圖案視為 OneLake 設計的基石。 大多數環境都會結合一種以上的類型。 選擇符合你目標的圖案:
- 統一資料存取與最小複製——使用 OneLake 從多個來源系統公開資料,且不複製資料。
- Medallion 架構(銅、銀、金) — 將資料整理成三層品質流程,從原始擷取到經認證的商業準備資料。
- 共享平台上的領域導向資料網格 ——使商業網域能在單一受管控的基礎上擁有並發布自己的資料產品。
- 分析與人工智慧平台整合——配置分析、資料科學與人工智慧工作負載,使其能在一份資料上運行。
- 跨組織的外部資料共享——讓合作夥伴和客戶無需匯出或重複複製即可存取 OneLake 資料。
統一資料存取與最小複製
如果你的資料分散在多個雲端、本地系統或外部湖泊中,將所有資料複製到一個地方可能不切實際,甚至可能無法實現。 統一的資料存取與最小複製模式,將 OneLake 視為跨越這些來源的單一邏輯資料層。 你不必為每個資料來源建置 ingest 管線,而是使用捷徑直接在原處參照資料,並在需要同步且針對查詢最佳化的副本時使用鏡像。
當下列情況時,請使用此模式:
- 你的資料分散在多個雲端、本地系統或外部湖泊中。
- 將資料複製到中央儲存會造成過多的儲存空間、延遲或合規負擔。
- 你需要快速導入新來源,而不必撰寫完整的萃取、轉換、載入(ETL)管線。
- 你希望保留對現有資料湖、倉庫和營運商店的投資。
應用統一資料存取
要實踐這個模式,先從兩種主要的資料存取方式開始,這些方法不需要你建置或操作資料移動流程: 虛擬化 讓來源資料透過 OneLake 可用且不複製,零 ETL 鏡像 則將平台管理、同步的副本以分析準備的 Delta 表格形式帶入 OneLake。 只有當這些方法不支援原始碼或不符合你的需求時,才使用 Fabric 資料移動工具。 如需更多有關如何選擇及組合這些方法的指引,請參閱 使用 OneLake 捷徑和鏡像統一資料。
盤點你的資料來源,判斷 OneLake 可以透過虛擬化或零 ETL 鏡像存取哪些來源:雲端物件儲存、外部目錄、營運資料庫和 Dataverse。 將所有其餘來源標示為需要採用資料移動方法。
為每個支援的來源選擇合適的資料存取技術。 當來源支援無複製存取時,偏好虛擬化。 當來源需要已同步且經過查詢最佳化的副本時,請使用零 ETL 鏡像複寫:
| 來源資料 | 如何存取 | 資料處理 |
|---|---|---|
| 雲端物件儲存(Azure Data Lake Storage Gen2、Amazon S3、Google Cloud Storage)以及相容 S3 的本地儲存 | 快速鍵 | 虛擬化:讓原始資料可用而無需複製 |
| 在外部目錄中管理,且你想在不複製的情況下提供使用的資料(例如 Azure Databricks Unity Catalog) | 元資料鏡像 - 僅同步目錄元資料(結構、資料表),並透過捷徑存取來源資料 | 虛擬化:讓原始資料可用而無需複製 |
| 需要查詢優化副本的操作性資料庫(Azure SQL Database、Azure Cosmos DB、Snowflake、PostgreSQL、SQL Server 2025、Oracle Database、Google BigQuery) | 資料庫鏡像,或用於受支援的自訂與合作夥伴解決方案的開放鏡像 | Zero-ETL 鏡像:建立同步的 Delta 副本 |
| Dataverse(Dynamics 365 與 Power Platform 資料) | 捷徑或連結至 Microsoft Fabric 以實現零複製存取 | 虛擬化:讓原始資料可用而無需複製 |
必要時轉換來源資料。 捷徑轉換可處理透過捷徑公開的支援檔案,無論這些檔案是儲存在外部,還是已儲存在 OneLake 中。 使用 捷徑檔案轉換 將結構化檔案轉換為 Delta 表格,或使用 捷徑 AI 轉換 處理非結構化文字。 捷徑轉換會產生轉換後的 Delta 輸出,並保持與捷徑所參考的資料同步。
當虛擬化和鏡像不支援原始碼,或需要複雜的轉換、編排、排程移動節奏或串流擷取時,請使用 Fabric 的資料移動工具。 如需協助在管線、資料流、複製工作與事件串流間做出選擇,請參閱 「選擇資料移動策略」。
當你選擇資料移動時,將複製的資料以開放表格格式放置,例如 Delta Parquet 或 Iceberg。 鏡像和捷徑轉換已可產生 Delta 輸出。 使用開放格式可讓虛擬化資料、同步副本及轉換後的 Delta 輸出能被 Fabric 引擎及外部平台讀取。
每當你建立同步副本、轉換後的 Delta 輸出,或透過 Fabric 資料移動工具複製時,請記錄原因。 此紀錄保持決策可審計性。 只有在來源需要實體且經查詢最佳化的配置,或無法以虛擬方式滿足您的資料新鮮度、轉換成本、合規性或處理需求時,才建立副本。
對透過 OneLake 提供的資料套用 OneLake 安全性 ,讓相同的政策涵蓋虛擬化資料、同步副本及轉換後的 Delta 輸出。
在 OneLake 目錄中為產生的資料項目背書並加以描述,讓使用者能夠找到並信任這些資料項目。
統一資料存取能力
- 資料虛擬化 與 零 ETL 鏡像 ——透過無複製參考或同步、分析準備的副本,揭露存在於其他系統與雲端的資料。 特徵:
-
集中式治理 ——對虛擬化來源實施一致的安全與發現,就像對待原生 OneLake 資料一樣。 特徵:
- OneLake 的安全與資料存取控制模型對 OneLake 的資料套用一致的存取政策。
- OneLake 目錄 支援探索與認證。
-
開放資料互通性——保持虛擬化資料及平台管理的副本能被 Fabric 引擎及外部平台讀取。 特徵:
- OneLake 中的 Iceberg 資料表讓 Iceberg 資料可供 Fabric 及外部引擎使用。
- Delta Parquet 是一種開放式表格格式,用於儲存分析準備資料。
- OneLake 存取與 API 讓 外部應用程式與工具能存取 OneLake 資料。
獎章建築(青銅、銀、金)
在 OneLake 中公開資料只是第一步。 來自原始系統的原始資料通常不安全,無法直接用於分析或人工智慧。 它經常包含重複、錯誤、格式不一致或敏感欄位。 當多個團隊在同一原始資料上建置時,他們需要一個共同定義,明確界定每個資料階段的資料可信賴範圍。
Medallion 架構模式將 OneLake 的資料組織成三個品質層:青銅色用於原始且不可變的原始資料;銀色代表淨化與合規資料;而金幣則用於認證、商業準備的表格與語意模型。 每一層都是明確的階段,下游消費者可以依賴。 銀色和金色表格可以在商業智慧、分析和 AI 工作負載中重複使用,讓團隊不必在不同工具中重建相同的清理或建模邏輯。
當下列情況時,請使用此模式:
- 多個團隊建立在同一個原始數據上,需要穩定的品質。
- 你需要從原始輸入到經過認證的輸出,有可追溯的血統。
- 你需要資料工程與分析或 AI 消費者之間有明確的合約。
欲了解更多此模式資訊,請參閱「了解 OneLake 的 Fabric medallion 架構」。 該文章涵蓋圖層設計、部署模型、儲存格式、實體化湖泊視圖及三角表格優化。
如何應用
一個運作中的徽章建立在一個理念上:每一層都是與下游消費者的合約,資料只有在達到該層的品質標準後才會進入下一層。
辨識你的原始來源以及依賴認證數據的消費者。
定義每個層中屬於什麼,並於不同領域中一致套用這些定義:
層 內容 典型消費者 青銅 原始且不可更改的資料直接從來源擷取,且無模式強制執行 資料工程師(有限存取權) 銀色 已清理、去除重複資料,並符合共用業務定義 資料工程師與受過訓練的分析師 黃金 精心整理、可供商務使用的資料表與語意模型 所有 BI、分析與 AI 使用者 使用適當的 Fabric 工作負載來建置各層——銅層和銀層通常使用 Data Engineering(Spark)或 Data Factory,金層則使用 Data Warehouse 或 Power BI 語意模型。 在青銅版中,請使用原始格式、可快速取得資料來源、Parquet 或 Delta 格式,以維持原始資料的真實度。 請為銀層和金層使用 Delta 資料表,讓 Fabric 工作負載能夠可靠地讀取及寫入經過精煉的資料。
套用層級感知存取政策。 對於支援的項目,請使用OneLake 安全性;對於倉庫,請使用適用的 Fabric 和 SQL 權限。 限制銅礦的取得,讓分析師能取得白銀,並根據消費者需求和最低特權標準授予黃金。
使用精選的金幣輸出來進行下游分析。 在 Direct Lake 模式下建立金層語意模型,讓 Power BI 能讀取 OneLake 資料,而不必建立匯入副本或排程更新。
確認每一種黃金產出都有可追溯的血脈,從銀到其青銅來源。 接著,將金層資料表和語意模型認可為已在 OneLake 目錄 中獲得認證。 此驗證有助於消費者辨識哪些資料已準備好用於生產環境。
重用黃金語意模型來啟動 Fabric IQ 本體論。 此步驟為 AI 代理提供基於認證數據的治理商業背景。
基礎功能
-
整合式分析與 AI - 銅層、銀層和金層可為 OneLake 上的所有分析與 AI 工作負載提供資料,無需建立引擎專屬複本。 特徵:
- OneLake 中的獎章式湖屋架構為這三個層級提供設計指引。
- 直接湖模式讓 Power BI 語意模型能直接從 OneLake 讀取黃金層資料。
- Fabric 工作負載如 Data Engineering 和 Data Warehouse 會產生並精煉這些層。
-
集中式治理 ——在每一層實施不同的存取政策與品質閘門,讓消費者只看到與其角色相符的資料。 特徵:
- OneLake 安全性 會強制執行具層級感知的存取原則。
- OneLake 目錄支援可感知分層的探索與認證功能。
- Microsoft Purview 會套用敏感性標籤與稽核。
-
開放資料互通性 - 將圖層以開放格式儲存,讓外部引擎能與 Fabric 一同讀取。 特徵:
- Delta Parquet 是一種用於儲存精煉層資料的開放表格格式。
- OneLake 中的 Iceberg 表格 讓相容 Iceberg 引擎能取得圖層資料。
- OneLake 存取與 API 讓外部應用程式與工具能存取層級資料。
共享平台上的領域導向資料網格
如果你有多個業務團隊同時產生和消費資料,將每個請求都經過單一中央資料團隊,可能會拖慢交付速度。 業務團隊通常最了解自己的資料與需求,但若沒有共享治理而分散所有權,可能導致安全性、品質與血統不一致。
以領域為導向的資料網格模式讓每個商業網域擁有自己的資料產品所有權,而所有網域則遵循 OneLake 基礎上的共享標準。 每個網域都發布自己的資料產品,其他網域則透過捷徑存取這些產品,並透過 Fabric 分析與 AI 工作負載來使用。 集中式的身份、安全與治理政策在所有領域中均一適用。
當下列情況時,請使用此模式:
- 單一的集中式資料團隊會成為交付流程的瓶頸。
- 不同的業務領域有不同的資料、需求和發布節奏。
- 你需要在領域層級對資料品質有明確的問責,同時不放棄企業層級的治理。
套用領域導向的資料網格
找到去中心化與一致性之間的適當平衡。 將所有權推向最了解資料的網域,並集中管理身份、安全與血統,讓每個網域的資料產品都符合相同標準。
明確你的商業領域。 每個領域應代表企業中一個連貫的領域,並由團隊負責並操作其數據產品,從端到端。
為每個業務領域建立 一個網域 ,並為其指派工作區。 建立一個獨立的中央網域,用於共享基礎設施和可重複使用的企業資料。
定義每個領域必須達成的資料產品標準——例如背書或認證要求、文件化的結構、所有權元資料、版本控制及服務水準協議(SLA)。 這些標準使每個產品成為可重複使用、可被發現的合約,而不僅僅是工作區資料夾。
利用 OneLake 安全性 在資料夾、資料表、列及欄層級套用基於角色的資料存取控制,讓生產者能發佈資料產品,而不必暴露工作區中的所有內容。
透過 OneLake 目錄應用租戶範圍治理以進行跨域發現與血統,並使用 Microsoft Purview 進行敏感標籤與稽核。 將相同的身份與政策模型擴展到消費網域資料產品的 AI 代理,讓代理的存取權限像其他消費者一樣被管理。
讓消費者領域使用 捷徑 來參考生產者資料產品,而不是複製。 消費者接著可以在符合需求的 Fabric 工作負載中使用參考資料產品。 對於 Power BI 語意模型,請使用 Direct Lake 模式直接從 OneLake 讀取資料。 使用 Fabric Data Agents 或 Fabric IQ,打造基於受控領域資料產品的 AI 體驗。
如果網域發佈到 Fabric 外的目錄,請規劃存取控制同步,以確保 OneLake 與外部目錄間的權限保持一致。
Tip
Microsoft 開源加速器 Policy Weaver 能自動化 Azure Databricks(Unity Catalog)、Snowflake 及 Dataverse 來源的同步。 它會將資料存取原則對應至 OneLake 安全性角色,作為鏡像功能的補充(後者只會移動資料,不會移動權限)。
資料網格功能
-
集中式治理 ——將所有權分散到網域,同時保持身份、安全與血脈的集中管理。 特徵:
- 網域依 商業區域分組工作空間。
- OneLake 安全性 提供以角色為基礎的資料夾、資料表、列和欄的存取控制。
- OneLake 目錄 促進跨域發現與血統管理。
- Microsoft Purview 會套用敏感性標籤與稽核。
-
資料虛擬化 ——讓消費者領域透過參考而非複製品,使用生產者擁有的資料產品。 特徵:
- 捷徑可 實現網域間零複製共享。
- 整合分析與人工智慧 — 讓每個領域的資料產品在 Fabric 工作負載中都能使用。 特徵:
分析與人工智慧平台整合
如果你同時運行多個分析平台——分別有資料倉儲、商業智慧、資料科學、即時分析和人工智慧的工具——每個工具都有自己的資料副本、管線和治理模型。 這種碎片化推高成本,也使得難以套用一致的安全措施或獲得單一商業問題的答案。
平台整合模式將這些工作負載帶到 Fabric,OneLake 提供共享且受控的資料基礎。 Fabric 工作負載透過這個基礎存取、轉換、同步或分析資料,而非依賴各自工具的獨立資料與治理模型。
當下列情況時,請使用此模式:
- 你正在使用多個功能重疊的分析平台。
- 引擎專用的資料複製與管線會導致成本上升,並增加維護負擔。
- 你需要一個涵蓋所有分析與 AI 工作負載的單一治理與安全模型。
應用平台整合
目標是減少平台數量,而非更多整合。 將工作負載整合到 Fabric 中,而不是把多個工具串接在一起;只有在外部引擎尚無法汰除時,才橋接這些外部引擎。
盤點你目前使用的分析、資料倉儲、資料科學、商業智慧(BI)及人工智慧工具與流程。 注意每個工具所服務的工作負載,以及它複製了哪些資料。
將每個現有工作負載映射到可以取代它的 Fabric 工作負載:
遺留工作量 Fabric 工作負載 數據協調流程和 ETL 數據處理站 Spark 筆記本與湖倉處理 資料工程 SQL 資料倉儲 數據倉儲 串流與KQL分析 即時智慧 機器學習模型訓練與實驗追蹤 數據科學 營運資料庫 資料庫(Fabric 中的 SQL 資料庫及 Fabric 中的 Cosmos DB) BI 視覺化與語意模型 Power BI 採用 Direct Lake 模式 基於企業數據的對話式人工智慧 Fabric 資料代理、Copilot for Fabric、Fabric IQ 利用 OneLake 安全、Microsoft Purview 及 OneLake 目錄,建立涵蓋所有工作負載的統一治理與安全模型。 當支援的 Fabric 項目需要另一層加密時,請設定客戶管理的金鑰。
透過使用 Delta 或 Iceberg 格式整合 OneLake 中的分析資料,讓工作負載能共享受控的資料基礎。 透過整合作業負載至 Fabric 資料庫,讓 OneLake 能提供同步的分析資料。
讓 AI 以整合後的資料為基礎。 在你策劃的資料層上建置本體(預覽),並透過 Ontology MCP 伺服器將本體暴露給代理,讓 Fabric Data Agents、Microsoft 365 Copilot 及外部工具能在同一個受控的上下文下進行推理。 你可以從 Power BI 語意模型以 Import、Direct Lake 或 DirectQuery 模式產生本體定義。 當你需要生成綁定到支援的 OneLake 資料時,請使用 Direct Lake 模式 ,並檢視目前本體論的限制。
對於尚無法淘汰的外部引擎,可透過 Azure Databricks 整合、Iceberg 與 Snowflake 的互通性,或 OneLake 存取與 API,讓其存取 OneLake 資料。
在驗證 Fabric 對應項目後,淘汰已被取代的工具、資料副本和管線。 這樣整合就能省去成本、授權和交接,而不是再增加一個平台。
平台整合能力
-
整合分析與人工智慧 — 將分析、資料科學與人工智慧工作負載整合於共享的 OneLake 基礎上。 特徵:
- Fabric 工作負載,例如 資料工廠、資料工程、資料倉儲、即時智慧、資料科學、資料庫,以及 Power BI,皆可透過共享基礎來存取、轉換、同步或分析資料。
- 直接湖模式讓 Power BI 語意模型能直接讀取 OneLake 資料。
- Fabric Data Agents、Copilot for Fabric 以及 Fabric IQ 支援以 OneLake 數據為基礎的 AI 體驗。
- 本體論與Ontology MCP 伺服器為 AI 代理提供受治理的業務情境。
- OneLake 作為 Microsoft Foundry 的知識來源,讓 Foundry 能索引 OneLake 檔案,供 AI 代理使用。
-
開放資料互通性 —— 讓你未淘汰的外部平台持續讀取相同的資料。 特徵:
- OneLake 和 Delta Parquet中的 Iceberg 表格以開放式表格格式保存資料。
- OneLake 存取與 API 讓 外部應用程式與工具能存取 OneLake 資料。
- Azure Databricks 整合與 Iceberg 與 Snowflake 的互通性,讓外部分析平台能讀取 OneLake 資料。
-
集中式治理 ——以涵蓋所有工作負載的治理與稽核模型取代每個工具的安全模型。 特徵:
- Fabric 治理提供跨 Fabric 工作負載的通用治理框架。
- OneLake 安全 系統採用一致的資料存取控制措施。
- OneLake 目錄支援跨工作負載的探索與譜系追蹤。
- Microsoft Purview 整合會套用敏感性標籤與稽核。
- 客戶管理的金鑰為支援的 Fabric 項目增添另一層加密。
組織間的外部資料共享
如果你持續與合作夥伴、供應商、客戶或其他部門交換資料,批次匯出、檔案傳輸及重複下游系統會增加延遲、成本與治理缺口。 外部資料共享模式讓組織或業務部門外的消費者能直接存取經過策劃的 OneLake 資料,無需重複匯出。 消費者可透過 Fabric 跨租戶共享或透過 OneLake 互通功能,從 Snowflake 和 Azure Databricks 等外部分析平台存取資料。
消費者會在你發布更新時看到。 你透過支援消費者平台的共享或互通機制來控制對原始資料的存取。
當下列情況時,請使用此模式:
- 你持續與外部組織交換資料。
- 批次匯出或檔案傳輸會增加延遲、複雜度或治理缺口。
- 你需要集中追蹤並撤銷外部存取權限。
應用外部資料共享
外部分享在使用虛擬化而非匯出資料時效果最佳。 將存取方式與每位消費者能讀取的內容相匹配,並套用該共享或互通機制所支援的存取控制。
找出你想對外分享的資料產品,以及需要這些資料的消費者(合作夥伴、供應商、客戶)。 通常,你會分享經過精心策劃且有文件說明的表格和檔案。
為每位消費者選擇合適的分享方式:
消費者類型 建議方法 另一個租戶中的 Fabric 使用者 外部資料共享,用於唯讀、虛擬化跨租戶存取 使用 Snowflake on Azure 的使用者 Iceberg 與 Snowflake 的互通性,用於讀取以 Iceberg 格式提供的 Fabric 表格 Azure Databricks 使用者 Azure Databricks 中的 OneLake 目錄聯盟,透過 Unity Catalog 查詢 OneLake 表格而無需複製資料 支援 ADLS Gen2 或 Blob API 的應用程式或工具 OneLake 存取與 API,以透過支援的 API 存取 OneLake 資料 若要在分享前將 Dataverse 資料導入 OneLake,請使用 統一的資料存取模式。
以所選共享機制所支持的權限範圍來擴大外部存取範圍。 對於 Fabric 外部資料分享,該共享會讓被邀請使用者的家鄉租戶中的任何使用者擁有唯讀權限。 提供者端的安全與治理政策,包括 OneLake 安全、敏感標籤及資料遺失防護政策,並未在消費者租戶中強制執行。 消費者必須管理其環境中的下游接入。
事先就每段共享關係的條件達成共識——分享什麼、與誰分享、以及持續多久。 對於 Fabric 外部資料分享,請在管理權限頁面的外部資料分享標籤中撤回存取權。 其他方法則可透過所選共享機制撤銷存取權限。 確認消費者失去可見性。
在供應商的 Fabric 環境中,使用 Microsoft Purview 套用敏感性標籤、稽核及資料遺失防護。
在 OneLake 目錄 中背書並記錄來源資料產品,讓服務提供者能在分享前找到並管理它們。 OneLake 目錄不會將資料產品發布給外部租戶或分析平台。
外部資料共享能力
- 資料虛擬化 - 透過無複製參考共享資料,無需管理匯出管線。 特徵:
-
開放資料互通性——透過以開放格式發佈,與不使用 Fabric 的消費者分享。 特徵:
- OneLake 中的 Iceberg 資料表 以開放式資料表形式發佈共享資料。
- Iceberg 與 Snowflake 的互通 性讓 Snowflake 消費者能讀取共享的 OneLake 資料。
- Azure Databricks 中的 OneLake 目錄聯盟讓 Azure Databricks 消費者透過 Unity Catalog 查詢 OneLake 資料表,無需複製資料。
- OneLake 存取與 API 讓相容的應用程式與工具能存取 OneLake 資料。
-
集中式治理 - 在 Fabric 中管理原始資料,並透過各共享機制控制外部存取。 特徵:
- OneLake 的安全範圍涵蓋 Fabric 中對原始資料的存取權限。
- Microsoft Purview 在提供者的 Fabric 環境中套用敏感標籤、稽核及資料遺失防護。
- OneLake 目錄支援在分享前由提供者端進行探索與背書。