什麼是 OneLake?

Microsoft OneLake 是您整個組織的統一資料湖。 每個 Microsoft Fabric 租戶自動包含 OneLake,這是你所有分析資料的唯一存放點。 它是一個中央資料庫,你可以在這裡儲存、管理並管理組織內所有分析與 AI 工作負載的數據。

OneLake 是建立在 Azure Data Lake Storage 上,並以 Delta Parquet 或 Iceberg 格式儲存資料表,這兩種開放標準任何工具都能讀取。 這種做法意味著你的資料不會被鎖定在專有格式中。

OneLake 提供:

  • 為整個組織提供統一的資料儲存,內建治理與安全性
  • 一份 資料副本,可用於多個分析引擎且不重複
  • 彈性連線可透過檔案總管、ADLS Gen2 API 及 Azure 服務整合實現
  • 具備內建冗餘、災難復原及存取診斷功能的資料保護與監控

統一資料儲存

在 OneLake 出現之前,組織常常為不同業務團隊建立多個湖泊,導致管理多重資源時產生額外負擔。 這種孤立的做法使團隊間協作變得困難,資料專案進度緩慢,並增加重複風險。

OneLake 透過提供整個組織的中央資料存取點來解決這些挑戰。 每個 Fabric 租用戶都會配有單一 OneLake 執行個體。 你無法刪除 OneLake 或建立多個 OneLake,也沒有基礎設施可供配置或管理。 部門、團隊與專案可將資料儲存或連接於此統一湖中,並透過 Fabric 網域、子網域與工作區來組織,每個領域都有自己的管理員。 此模式維持資料所有權並實現聯邦治理,同時允許授權使用者無阻礙地發現與使用資料。

集中管理,分散所有權

Fabric 資料存在以下組織與治理階層:

  • 租戶:租戶層級政策會自動保護任何進入 OneLake 的資料,以保障安全、合規及資料管理。
  • 工作區:你可以在租戶中建立任意數量的工作區來組織資料。 工作區可使組織的不同部分能夠散發所有權與存取原則。 每個工作區都是綁定在特定區域並分別計費的容量中的一部分。
  • 資料項目:工作區包含如湖屋、倉庫、事件屋及 KQL 資料庫等資料項目。 每種項目類型都是針對特定工作負載(如基於 Spark 的分析、T-SQL 查詢、即時串流等)專門打造的。

顯示 OneLake 函數與結構的圖表。

如需詳細資訊,請參閱工作區

透過 OneLake 目錄探索和管理

OneLake 目錄是資料專業人士與商業用戶發現、管理並管理他們在 OneLake 上可存取的資料的唯一平台。

使用者可依網域、工作區、項目類型、背書等篩選,精確找到所需資料,每個資料項目都因描述、擁有者、結構、血統及使用指標等元資料而豐富。

資料擁有者可獲得洞察與建議行動,以提升資料品質與合規性,包括敏感性標籤覆蓋、標籤、背書及資料定位的可見性。

欲了解更多資訊,請參閱 OneLake 目錄

安全性

OneLake 的安全模型讓你能廣泛分享資料,同時不暴露敏感資訊。 透過使用 OneLake 的安全角色,你可以對資料項目定義細緻的權限,甚至是特定的資料夾、表格,甚至列和欄。 例如,你可以與團隊分享銷售資料集,但限制對 Cost 欄的存取權限,或允許合作夥伴只能查看 Region = "US" 的資料列。 OneLake 會儲存這些角色,並自動在所有分析體驗中強制執行。 因此,如果使用者只能存取資料集的一部分,這條規則無論他們是透過 SQL 查詢、使用 Spark 筆記本,還是查看 Power BI 報告,都適用。 OneLake 確保他們只看到被允許看到的內容。

這種統一的安全方法意味著使用者不必在不同引擎間維持獨立權限。 這也意味著原始資料擁有者始終掌控誰能存取資料來源,即使資料被傳到他人擁有的湖屋或工作區。

你可以像對文件一樣,對 OneLake 項目套用敏感度標籤,這些標籤即使資料匯出到 Excel 或其他工具,也會強制加密或限制存取。 同樣地,資料遺失防護(DLP)政策能偵測 OneLake 的敏感資料上傳或下載,並預防或警示潛在的資料外洩。

欲了解更多資訊,請參閱 「開始在 OneLake 中保護你的資料」。

一份資料複本

所有 Fabric 分析引擎都直接在 OneLake 中處理資料。 你不需要複製資料就能用其他引擎或分析多個來源的資料。

快捷方式

捷徑是指引用儲存在其他檔案位置的資料。 這些檔案位置可以在同一工作區內,或是 OneLake 的不同工作區,或是 OneLake 外部。 你可以針對 OneLake、Azure Data Lake Storage、Azure Blob 儲存體、Amazon S3 和 S3 相容來源、與 Iceberg 相容的來源、Microsoft Dataverse、內部部署來源等使用捷徑。 不論位置為何,捷徑的方式會讓檔案與資料夾看起來就像儲存在本機一樣。

捷徑讓您的組織能夠跨雲端和領域統一資料,而不必複製資料。 Teams 可以在不同的工作區獨立工作,並使用捷徑彼此分享資料,避免重複資料。 例如,一個團隊可以建立一個捷徑,指向另一個團隊工作區的資料集或外部 S3 桶,然後將該資料與 OneLake 中的自己資料合併。 捷徑指向來源,因此當來源資料更新時,這些變更會立即透過 OneLake 顯示。 這樣一來,你可以建立虛擬產品或視圖,將多個業務群組的資料整合成符合特定需求,且不會移動或重複資料。 透過捷徑轉換,你甚至可以自動更改資料,例如轉換資料格式或移除個人識別資訊(PII)。

此圖表顯示捷徑方式如何跨工作區與項目連接資料。

如需有關如何使用捷徑的詳細資訊,請參閱 OneLake 捷徑

Mirroring

Fabric 中的鏡像是一種低成本、低延遲的解決方案,能持續將各種系統的資料複製到 OneLake。 您可以安全地連接外部資料來源,並自動將選取的資料庫或資料表鏡像(複製)到 OneLake 的開放格式,保持近乎即時的同步。 鏡像資料會以 Delta Parquet 形式儲存在 OneLake,因此任何 Fabric 引擎都能立即分析。

鏡像支援的來源包括 Azure SQL Database、Azure Cosmos DB、適用於 PostgreSQL 的 Azure 資料庫、Azure Databricks(Unity Catalog)、Snowflake 等。 來源資料的變更會持續同步,因此您的 OneLake 副本無需手動執行 ETL 作業即可保持最新狀態。 你可以對新資料執行分析、AI 或 Power BI 報告,而不必直接查詢生產來源。

更多資訊請參見 Fabric 中的鏡像是什麼?

在多個分析引擎中協作

Fabric 的分析引擎(T-SQL、Apache Spark、Analysis Services 等)皆以開放式 Delta Parquet 格式儲存資料於 OneLake。 這種標準化讓你能在多個引擎上使用相同的資料。 你不需要複製資料才能用到其他引擎,或因為資料存放在某個引擎而覺得被綁住。

舉例來說,一組 SQL 工程師建構了完全交易式的資料倉儲。 他們使用 T-SQL 引擎來建立資料表、轉換資料,並將資料載入資料表。 如果資料科學家想利用這些資料,他們可以將 Spark 筆記本連接到 OneLake,直接讀取這些資料表。 由於 OneLake 以 Delta 格式儲存資料表,Spark 可以直接載入資料表,無需特殊連接器或資料匯出。 SQL 查詢和 Spark 工作都在 OneLake 中對同一份資料進行操作。

此外,商業用戶可透過分析服務引擎中的直接湖模式,在 OneLake 之上建置 Power BI 報告。 直接湖模式是一種資料存取模式,能快速載入並刷新大量資料,且無需複製。 如需詳細資訊,請參閱 Direct Lake 概觀

範例圖示顯示使用 Spark 載入資料、使用 T-SQL 查詢,以及在 Power BI 報告中查看資料。

開放表格格式的互通性

OneLake 透過中繼資料虛擬化支援 Delta Lake 和 Apache Iceberg 資料表格式。 此功能會自動產生虛擬元資料,使 Iceberg 表格能在 Fabric 工作負載中被讀取為 Delta Lake 表格,外部 Iceberg 讀取器也能讀取 Delta Lake 表格。 你可以直接寫入 Iceberg 表格到 OneLake,或建立對外部儲存的 Iceberg 表格的捷徑,OneLake 讓所有 Fabric 引擎都能使用,無需手動轉換。 同樣,OneLake 中的任何 Delta Lake 資料表都可由 Snowflake 等與 Iceberg 相容的服務存取。

如需詳細資訊,請參閱 搭配 OneLake 使用 Iceberg 數據表

連線到 OneLake

你可以從 Fabric 入口網站、Windows、現有的 Azure 工具,或任何支援 ADLS Gen2 API 的應用程式存取 OneLake 資料。

適用 Windows 的 OneLake 檔案總管

你可以在 Windows 中使用 Windows 版 OneLake 檔案總管來探索 OneLake 資料。 您可以瀏覽所有工作區與資料項目,輕鬆地上傳、下載或修改檔案,就像您在 Office 中所做的一樣。 OneLake 檔案總管讓資料湖的使用更簡單,因此即使是不具技術背景的商務使用者也能使用資料湖。

如需相關資訊,請參閱 OpenLake 檔案總管

ADLS Gen2 API 與 SDK

OneLake 支援 Azure Data Lake Storage(ADLS)Gen2 API 和 SDK,因此你可以使用現有的 ADLS Gen2 應用程式。 每個工作區都以容器形式出現,資料項目則以容器內的資料夾形式出現。 如需詳細資訊,請參閱 OneLake 存取和 API

此圖顯示如何使用 API 與 SDK 存取 OneLake 資料。

因為 OneLake 相容於 ADLS Gen2 應用程式,你可以從 Azure 服務連接 OneLake。 例如:

資料保護與監控

OneLake 內建功能,能保護您的資料安全,並讓您能清楚了解其使用情況。

災難復原與資料保護

OneLake 會自動以內建冗餘保護您的資料。 在支援可用性區域的地區,OneLake 使用區域冗餘儲存(ZRS)來跨多個資料中心複製資料。 在其他地區,則使用本地冗餘儲存(LRS)。 為了進一步防範整個區域層級的中斷,你可以在容量上啟用業務持續性與災難復原(BCDR),將資料異地複寫到配對的 Azure 區域。 OneLake 也支援軟刪除,能保留已刪除檔案七天,讓你能從意外刪除中恢復。

欲了解更多資訊,請參閱 OneLake 的災難復原與資料保護

診斷

OneLake 診斷可讓您清楚了解資料在整個 Fabric 環境中的存取與使用情況。 當你在工作區層級啟用診斷時,它會將資料存取事件以日誌形式串流到湖屋。 你可以追蹤誰何時、以及如何存取了哪些資料。 這些日誌涵蓋了 Fabric UI 中的使用者操作、透過 API 與分析引擎進行程式化存取,以及透過捷徑進行跨工作空間存取。

如需詳細資訊,請參閱 OneLake 診斷