Co je OneLake?

Microsoft OneLake je sjednocené datové jezero pro celou organizaci. Každý Microsoft Fabric tenant automaticky zahrnuje OneLake a je to jediné místo pro všechna analytická data. Je to centrální úložiště, kde můžete ukládat, spravovat a řídit všechna data pro analýzy a úlohy AI v celé organizaci.

OneLake je postaven na Azure Data Lake Storage a ukládá tabulky ve formátu Delta Parquet nebo Iceberg, dva otevřené standardy, které může každý nástroj číst. Tento přístup znamená, že vaše data nejsou uzamčená do vlastních formátů.

OneLake poskytuje:

  • Jednotné úložiště dat pro celou organizaci s integrovanými zásadami správného řízení a zabezpečením
  • Jedna kopie dat pro použití s více analytickými nástroji bez duplikace
  • Flexibilní připojení prostřednictvím Průzkumníka souborů, rozhraní API ADLS Gen2 a integrace služeb Azure
  • Ochrana a monitorování dat s využitím integrované redundance, zotavení po havárii a diagnostiky přístupu

Jednotné úložiště dat

Organizace před OneLakem často vytvářely více jezer pro různé obchodní skupiny, což vedlo k dodatečné režii při správě více prostředků. Tento izolovaný přístup ztěžoval spolupráci mezi týmy, zpomaloval datové projekty a zvyšoval riziko duplicit.

OneLake tyto výzvy řeší tím, že vám poskytne centrální datový přístupový bod pro celou organizaci. Každý Fabric tenant má jednu instanci OneLake. Nemůžete odstranit OneLake ani vytvořit více OneLakes a není potřeba zřizovat ani spravovat žádnou infrastrukturu. Oddělení, týmy a projekty můžou ukládat nebo připojovat svá data v tomto sjednoceném jezeře a organizovat je pomocí Fabric domén, dílčích domén a pracovních prostorů – každý s vlastním správcem. Tento model udržuje vlastnictví dat a umožňuje federované zásady správného řízení a zároveň umožňuje autorizovaným uživatelům zjišťovat a používat data bez tření.

Centrálně spravované s distribuovaným vlastnictvím

Data Fabric jsou pro účely organizace a správy uspořádána v následující hierarchii:

  • Tenant: Zásady na úrovni tenanta automaticky chrání všechna data, která jsou v OneLake, kvůli zabezpečení, dodržování předpisů a správě dat.
  • Pracovní prostor: Můžete vytvořit libovolný počet pracovních prostorů ve vašem tenantovi pro uspořádání dat. Pracovní prostory umožňují různým částem organizace distribuovat zásady vlastnictví a přístupu. Každý pracovní prostor je součástí kapacity, která je svázaná s konkrétní oblastí a fakturuje se samostatně.
  • Položky dat: Pracovní prostory obsahují položky dat, jako jsou lakehouses, datové sklady, eventhouses a databáze KQL. Každý typ položky je určený pro konkrétní úlohy, jako jsou analýzy založené na Sparku, dotazy T-SQL, streamování v reálném čase a další.

Diagram znázorňující funkci a strukturu OneLake

Další informace najdete v tématu Pracovní prostory.

Zjišťování a řízení pomocí katalogu OneLake

Katalog OneLake je jediné místo, kde můžou odborníci na data a podnikoví uživatelé zjišťovat, spravovat a řídit data, která vlastní, a mít k nim přístup v rámci OneLake.

Uživatelé můžou filtrovat podle domény, pracovního prostoru, typu položky, doporučení a dalších informací, aby našli přesně to, co potřebují, s každou datovou položkou rozšířenou podle metadat, jako jsou popisy, vlastníci, schéma, rodokmen a metriky využití.

Vlastníci dat mohou získat přehledy a doporučená opatření ke zlepšení kvality dat a souladu s předpisy, včetně přehledu o pokrytí popisky citlivosti, označování, schválení a umístění dat.

Další informace najdete v katalogu OneLake.

Zabezpečení

Model zabezpečení OneLake umožňuje sdílet data široce bez zveřejnění citlivých informací. Pomocí rolí zabezpečení OneLake můžete definovat podrobná oprávnění k datovým položkám, až po konkrétní složky, tabulky nebo dokonce řádky a sloupce. Můžete například sdílet datovou sadu prodeje s týmem, ale omezit přístup ke Cost sloupci, nebo můžete partnerovi umožnit zobrazit pouze řádky, ve kterých Region = "US". OneLake tyto role ukládá a automaticky je vynucuje napříč všemi analytickými prostředími. Takže pokud má uživatel přístup jenom k části datové sady, toto pravidlo použije, jestli se dotazuje přes SQL, spustí poznámkový blok Sparku nebo zobrazí sestavu Power BI. OneLake zajistí, aby viděli jenom to, co mají povoleno vidět.

Tento jednotný přístup k zabezpečení znamená, že uživatelé nemusí udržovat samostatná oprávnění napříč různými moduly. Také to znamená, že původní vlastníci dat vždy udržují kontrolu nad tím, kdo má přístup ke zdroji dat, i když jsou data předána do jezera nebo pracovního prostoru vlastněného někým jiným.

Popisky citlivosti můžete použít u položek OneLake stejně jako u dokumentu a tyto popisky vynucují omezení šifrování nebo přístupu, i když se data exportují do Excel nebo jiného nástroje. Zásady ochrany před únikem informací můžou také detekovat nahrání nebo stahování citlivých dat z OneLake a zabránit potenciálním únikům dat nebo upozorňovat na potenciální úniky dat.

Další informace najdete v tématu Začínáme se zabezpečením dat ve OneLake.

Jedna kopie dat

Všechny analytické moduly Fabric pracují s daty přímo ve OneLake. Nemusíte kopírovat data, abyste je mohli používat s jiným modulem nebo analyzovat data z více zdrojů.

Zkratky

Zástupce je odkaz na data uložená v jiných umístěních souborů. Tato umístění souborů můžou být ve stejném pracovním prostoru, v jiném pracovním prostoru ve OneLake nebo v externím prostředí OneLake. Můžete použít klávesové zkratky pro OneLake, Azure Data Lake Storage, Azure Blob Storage, kompatibilní zdroje Amazon S3 a S3, zdroje kompatibilní s Icebergem, Microsoft Dataverse, místní zdroje a další. Bez ohledu na umístění budou klávesové zkratky soubory a složky vypadat, jako byste je uložili místně.

Klávesové zkratky umožňují vaší organizaci sjednotit data napříč cloudy a doménami bez jejich kopírování. Týmy můžou pracovat nezávisle na samostatných pracovních prostorech a místo duplikování dat používat klávesové zkratky k vzájemnému sdílení dat. Jeden tým může například vytvořit zástupce k datové sadě v pracovním prostoru jiného týmu nebo k externímu bucketu S3 a pak tato data zkombinovat s vlastními daty v OneLake. Odkaz směřuje na zdroj, takže když se zdrojová data aktualizují, tyto změny jsou v OneLake okamžitě viditelné. Tímto způsobem můžete vytvořit virtuální produkty nebo zobrazení, které stahují data z více obchodních skupin, aby vyhovovaly konkrétnímu potřeba, aniž byste je museli přesouvat nebo duplikovat. Pomocí transformací pomocí zkratek můžete dokonce automaticky provádět změny dat, například převádět data do jiného formátu nebo odstraňovat osobně identifikovatelné údaje (PII).

Diagram znázorňující, jak klávesové zkratky propojují data mezi pracovními prostory a položkami

Další informace o tom, jak používat klávesové zkratky, najdete v tématu Klávesové zkratky OneLake.

Mirroring

Zrcadlení v Fabric je nízkonákladové řešení s nízkou latencí, které průběžně replikuje data z různých systémů do OneLake. Můžete se bezpečně připojit k externímu zdroji dat a automaticky zrcadlit (kopírovat) vybrané databáze nebo tabulky do otevřeného formátu OneLake a synchronizovat je téměř v reálném čase. Zrcadlová data jsou uložena jako Delta Parquet v OneLake, takže jsou okamžitě připravena pro analýzu libovolným modulem prostředí Fabric.

Zrcadlení podporuje zdroje, jako jsou Azure SQL Database, Azure Cosmos DB, Azure Database for PostgreSQL, Azure Databricks (Katalog Unity), Snowflake a další. Změny ve zdroji se neustále šíří, takže vaše kopie OneLake zůstane up-to-date bez ručních úloh ETL. Můžete spouštět analýzy, AI nebo Power BI sestavy s čerstvými daty bez přímého dotazování na produkční zdroj.

Další informace najdete v tématu Co je zrcadlení v Fabric?

Spolupracujte v několika analytických enginech

Analytické moduly Fabric (T-SQL, Apache Spark, Analysis Services a další) ukládají všechna data v OneLake v otevřeném formátu Delta Parquet. Tato standardizace umožňuje používat stejná data napříč několika moduly. Nemusíte kopírovat data jen proto, abyste je mohli používat s jiným enginem, nebo se cítit uvězněni ve používání konkrétního enginu jen proto, že tam máte svá data.

Například tým inženýrů SQL vytvoří plně transakční datový sklad. Používají modul T-SQL k vytváření tabulek, transformaci dat a načítání dat do tabulek. Pokud datový vědec chce tato data používat, může k OneLake připojit poznámkový blok Sparku a tyto tabulky číst přímo. Protože OneLake ukládá tabulky ve formátu Delta, Spark je může načíst bez speciálních konektorů nebo exportů dat. Dotazy SQL i úlohy Sparku fungují na jedné kopii dat v OneLake.

Kromě toho můžou podnikoví uživatelé vytvářet sestavy Power BI nad OneLake pomocí režimu Direct Lake v modulu Analysis Services. Režim Direct Lake je režim přístupu k datům, který načítá a aktualizuje velké objemy dat rychle, aniž byste museli vytvořit kopii. Další informace najdete v tématu Direct Lake – přehled.

Příklad diagramu znázorňující načítání dat pomocí Sparku, dotazování pomocí T-SQL a zobrazení dat v sestavě Power BI

Interoperabilita formátu otevřené tabulky

OneLake podporuje formáty tabulek Delta Lake i Apache Iceberg prostřednictvím virtualizace metadat. Tato funkce automaticky generuje virtuální metadata, aby tabulky Iceberg mohly být čteny jako tabulky Delta Lake napříč Fabric úlohami a tabulky Delta Lake mohou číst externí čtenáři Icebergu. Tabulky Iceberg můžete zapisovat přímo do OneLake nebo vytvářet zástupce k externě uloženým tabulkám Iceberg a OneLake je bez ručního převodu zpřístupní všem modulům Fabric. Podobně k jakékoli tabulce Delta Lake v OneLake mají přístup služby kompatibilní s Icebergem, jako je Snowflake.

Další informace naleznete v tématu Použití tabulek Iceberg s OneLake.

Připojení k OneLake

K datům OneLake můžete přistupovat z portálu Fabric, Windows, existujících nástrojů Azure nebo jakékoli aplikace, která podporuje rozhraní API ADLS Gen2.

Průzkumník souborů OneLake pro Windows

Data OneLake z Windows můžete prozkoumat pomocí Průzkumníka souborů OneLake pro Windows. Můžete procházet všechny pracovní prostory a datové položky, snadno nahrávat, stahovat nebo upravovat soubory stejně jako v Office. Průzkumník souborů OneLake zjednodušuje práci s datovými jezery, takže je můžou používat i netechnické firemní uživatelé.

Další informace najdete v průzkumníku souborů OneLake.

Rozhraní API ADLS Gen2 a sady SDK

OneLake podporuje Azure Data Lake Storage (ADLS) Gen2 API a sady SDK, takže můžete použít existující aplikace ADLS Gen2. Každý pracovní prostor se zobrazí jako kontejner a datové položky se zobrazí jako složky v rámci těchto kontejnerů. Další informace najdete v tématu Přístup k OneLake a rozhraní API.

Diagram znázorňující, jak můžete přistupovat k datům OneLake pomocí rozhraní API a sad SDK

Vzhledem k tomu, že OneLake je kompatibilní s aplikacemi ADLS Gen2, můžete se k OneLake připojit z Azure služeb. Příklad:

Ochrana a monitorování dat

OneLake obsahuje integrované funkce, které vám umožní zajistit bezpečnost dat a získat přehled o tom, jak se používají.

Zotavení po havárii a ochrana dat

OneLake automaticky chrání vaše data pomocí integrované redundance. V oblastech, které podporují zóny dostupnosti, používá OneLake zónově redundantní úložiště (ZRS) k replikaci dat napříč několika datovými centry. V jiných oblastech používá místně redundantní úložiště (LRS). Pro další ochranu před výpadky v celém regionu můžete u kapacity povolit kontinuitu provozu a zotavení po havárii (BCDR) a geograficky replikovat data do spárovaného regionu Azure. OneLake také podporuje obnovitelné odstranění, které uchovává odstraněné soubory po dobu sedmi dnů, abyste se mohli zotavit z náhodných odstranění.

Další informace najdete v tématu Zotavení po havárii a ochrana dat pro OneLake.

Diagnostics

Diagnostika OneLake poskytuje přehled o přístupu k datům a jejich používání v prostředí Fabric. Když na úrovni pracovního prostoru povolíte diagnostiku, události přístupu k datům se budou průběžně odesílat ve formě protokolů do úložiště lakehouse. Můžete sledovat, kdo přistupoval k jakým datům, kdy a jak. Toto protokolování zahrnuje akce uživatelů v uživatelském rozhraní Fabric, programový přístup prostřednictvím rozhraní API a analytických nástrojů a přístup napříč pracovními prostory prostřednictvím zástupců.

Další informace najdete v tématu Diagnostika OneLake.