Čo je OneLake?

Microsoft OneLake je jednotné dátové jazero pre celú vašu organizáciu. Každý nájomca Microsoft Fabric automaticky zahŕňa OneLake a je to jediné miesto pre všetky vaše analytické dáta. Je to centrálny repozitár, kde môžete ukladať, spravovať a spravovať všetky dáta pre analytiku a AI pracovné zaťaženia v celej organizácii.

OneLake je postavený na Azure Data Lake Storage a ukladá tabuľky vo formátoch Delta Parquet alebo Iceberg, dvoch otvorených štandardoch, ktoré dokáže čítať akýkoľvek nástroj. Tento prístup znamená, že vaše dáta nie sú uzamknuté v proprietárnych formátoch.

OneLake poskytuje:

  • Jednotné ukladanie dát pre celú organizáciu s integrovaným riadením a bezpečnosťou
  • Jedna kópia dát na použitie s viacerými analytickými enginmi bez duplicít
  • Flexibilná konektivita cez prieskumníka súborov, ADLS Gen2 API a integrácie Azure služieb
  • Ochrana dát a monitorovanie s integrovanou redundanciou, obnovou po havárii a diagnostikou prístupu

Jednotné ukladanie dát

Pred OneLake organizácie často vytvárali viacero jazier pre rôzne obchodné skupiny, čo viedlo k dodatočným nákladom na správu viacerých zdrojov. Tento izolovaný prístup sťažoval spoluprácu medzi tímami, spomaľoval dátové projekty a zvyšoval riziko duplicity.

OneLake tieto výzvy rieši tým, že vám poskytuje centrálny prístup k dátam pre celú organizáciu. Každý nájomca Fabric má jednu inštanciu OneLake. Nemôžete vymazať OneLake ani vytvoriť viacero OneLakes a neexistuje žiadna infraštruktúra na provisionovanie alebo správu. Oddelenia, tímy a projekty môžu ukladať alebo sa pripájať k svojim dátam v tomto jednotnom jazere a organizovať ich pomocou Fabric domén, subdomén a pracovných priestorov – každý so svojím vlastným administrátorom. Tento model zachováva vlastníctvo dát a umožňuje federované riadenie, pričom stále umožňuje oprávneným používateľom objavovať a používať dáta bez preklínaní.

Centrálne spravované s distribuovaným vlastníctvom

Fabric dáta existujú v nasledujúcej hierarchii organizácie a správy:

  • Nájomca: Politiky na úrovni nájomcu automaticky chránia akékoľvek dáta, ktoré sa dostanú do OneLake pre bezpečnosť, súlad a správu dát.
  • Workspace: Môžete vytvoriť ľubovoľný počet pracovných priestorov vo vašom tenante na organizáciu dát. Pracovné priestory umožňujú rôznym častiám organizácie distribuovať politiky vlastníctva a prístupu. Každý pracovný priestor je súčasťou kapacity, ktorá je viazaná na konkrétny región a fakturovaná samostatne.
  • Dátové položky: Pracovné priestory obsahujú dátové položky ako jazerné domy, sklady, eventhouses a databázy KQL. Každý typ položky je špeciálne navrhnutý pre špecifické pracovné záťaže, ako je analytika založená na Spark, T-SQL dotazy, streamovanie v reálnom čase a ďalšie.

Diagram znázorňujúci funkciu a štruktúru OneLake.

Ďalšie informácie nájdete v téme Pracovné priestory.

Objavujte a spravujte s katalógom OneLake

Katalóg OneLake je jediným miestom pre dátových profesionálov a firemných používateľov, kde môžu objavovať, spravovať a spravovať dáta, ktoré vlastnia a k ktorým majú prístup v rámci OneLake.

Používatelia môžu filtrovať podľa domény, pracovného priestoru, typu položky, overení a ďalších prvkov, aby presne našli to, čo potrebujú, pričom každá dátová položka je obohatená o metadáta, ako sú popisy, vlastníci, schéma, pôvod a metriky používania.

Vlastníci údajov môžu získať poznatky a odporúčané opatrenia na zlepšenie kvality a súladu údajov, vrátane prehľadu o pokrytí citlivých štítkov, označovaní, odporúčaniach a lokalizácii údajov.

Viac informácií nájdete v katalógu OneLake.

Security

Bezpečnostný model OneLake vám umožňuje zdieľať dáta široko bez toho, aby ste odhalili citlivé informácie. Použitím bezpečnostných rolí OneLake môžete definovať detailné oprávnenia na dátové položky, až po konkrétne priečinky, tabuľky alebo dokonca riadky a stĺpce. Napríklad môžete zdieľať predajný dataset s tímom, ale obmedziť prístup k stĺpcu Cost , alebo môžete partnerovi dovoliť vidieť len riadky, kde Region = "US". OneLake tieto pozície ukladá a automaticky ich vynucuje vo všetkých analytických oblastiach. Ak má používateľ prístup len k časti datasetu, toto pravidlo platí bez ohľadu na to, či dotazuje cez SQL, spúšťa Spark notebook alebo si prezerá Power BI report. OneLake zabezpečuje, že vidia len to, čo im je dovolené vidieť.

Tento jednotný prístup k bezpečnosti znamená, že používatelia nemusia udržiavať samostatné oprávnenia medzi rôznymi enginmi. Tiež to znamená, že pôvodní vlastníci dát si vždy udržiavajú kontrolu nad tým, kto môže pristupovať k zdroju dát, aj keď sú dáta odovzdané do jazerného domu alebo pracovného priestoru, ktorý vlastní niekto iný.

Môžete aplikovať štítky citlivosti na položky OneLake rovnako ako na dokument, a tieto štítky vynucujú šifrovanie alebo obmedzenia prístupu aj v prípade, že dáta sú exportované do Excelu alebo iného nástroja. Rovnako politiky prevencie straty dát (DLP) dokážu detegovať nahrávanie alebo sťahovanie citlivých údajov z OneLake a predchádzať alebo upozorniť na možné úniky dát.

Viac informácií nájdete v článku Ako začať zabezpečiť svoje dáta v OneLake.

Jedna kópia údajov

Všetky analytické enginy Fabric pracujú priamo s dátami v OneLake. Nemusíte kopírovať dáta, aby ste ich mohli použiť s iným enginem alebo analyzovať dáta z viacerých zdrojov.

Shortcuts

Odkaz je odkaz na údaje uložené v iných umiestneniach súboru. Tieto umiestnenia súborov môžu byť v tom istom pracovnom priestore, v inom pracovnom priestore v OneLake alebo mimo OneLake. Môžete použiť skratky pre OneLake, Azure Data Lake Storage, Azure Blob storage, zdroje kompatibilné s Amazon S3 a S3, Iceberg-kompatibilné zdroje, Microsoft Dataverse, lokálne zdroje a ďalšie. Bez ohľadu na umiestnenie skratky vyzerajú, ako by súbory a priečinky vyzerali tak, ako keby boli uložené lokálne.

Skratky umožňujú vašej organizácii zjednotiť dáta naprieč cloudmi a doménami bez ich kopírovania. Tímy môžu pracovať samostatne v samostatných pracovných priestoroch a používať skratky na zdieľanie dát medzi sebou namiesto ich duplikácie. Napríklad jeden tím môže vytvoriť skratku k datasetu v pracovnom priestore iného tímu alebo k externému S3 bucketu a potom tieto dáta skombinovať so svojimi vlastnými v OneLake. Skratka ukazuje na zdroj, takže keď sa zdrojové dáta aktualizujú, tieto zmeny sú okamžite viditeľné cez OneLake. Týmto spôsobom môžete vytvárať virtuálne produkty alebo pohľady, ktoré spájajú dáta z viacerých obchodných skupín podľa konkrétnej potreby, bez presúvania alebo duplikácie dát. Použitím skratkových transformácií môžete dokonca aplikovať automatické zmeny na dáta, ako je konverzia formátu dát alebo odstránenie osobných identifikovateľných údajov (PII).

Diagram znázorňujúci, ako skratky spájajú údaje medzi pracovnými priestormi a položkami.

Ďalšie informácie o používaní skratiek nájdete v téme Skratky OneLake.

Mirroring

Zrkadlenie v Fabric sprístupňuje externú databázu alebo katalóg cez OneLake bez toho, aby ste museli vytvárať a prevádzkovať pipeline na pohyb dát. Zrkadlenie vždy pridáva metadáta zdrojového katalógu do Fabric. Spôsob, akým sprístupní základné údaje, závisí od zdroja.

  • Zrkadlenie databáz neustále replikuje dáta z prevádzkovej databázy do OneLake ako analyticky pripravené tabuľky Delta.
  • Zrkadlenie metadát synchronizuje externý katalóg a používa skratky na prístup k jeho otvoreným dátam priamo na mieste bez ich kopírovania.

Pre rady pri výbere medzi skratkami a zrkadlením a ich kombinovaným používaním pozri Unify data with OneLake shortcuts and mirroring. Pre koncepty zrkadlenia a podporované zdroje pozri Čo je zrkadlenie v Fabric?

Spolupráca vo viacerých analytických enginoch

Analytické enginy Fabric (T-SQL, Apache Spark, Analysis Services a ďalšie) všetky ukladajú dáta v OneLake v otvorenom formáte Delta Parquet. Táto štandardizácia umožňuje používať rovnaké dáta naprieč viacerými enginmi. Nemusíte kopírovať dáta len preto, aby ste ich mohli použiť s iným engineom, alebo sa cítiť zaseknutí pri použití konkrétneho enginu, pretože tam sú vaše dáta.

Napríklad tím SQL inžinierov vytvára plne transakčný dátový sklad. Používajú T-SQL engine na tvorbu tabuliek, transformáciu dát a načítanie dát do tabuliek. Ak chce dátový vedec tieto dáta využiť, môže pripojiť Spark notebook k OneLake a čítať tieto tabuľky priamo. Keďže OneLake ukladá tabuľky vo formáte Delta, Spark ich môže načítať bez špeciálnych konektorov alebo exportu dát. SQL dotazy aj Spark úlohy pracujú na jednej kópii dát v OneLake.

Okrem toho môžu firemní používatelia vytvárať Power BI reporty na OneLake pomocou režimu Direct Lake v engine Analysis Services. Režim Direct Lake je režim prístupu k dátam, ktorý rýchlo načítava a obnovuje veľké objemy dát bez potreby kopírovania. Ďalšie informácie nájdete v téme Prehľad Direct Lake.

Príklad diagramu zobrazujúci načítanie dát pomocou Sparku, dotazovanie pomocou T-SQL a prezeranie dát v Power BI reporte.

Interoperabilita formátu otvorených tabuliek

OneLake podporuje formáty tabuliek Delta Lake aj Apache Iceberg prostredníctvom virtualizácie metadát. Táto funkcia automaticky generuje virtuálne metadáta, takže tabuľky Iceberg môžu byť čítané ako tabuľky Delta Lake naprieč Fabric záťažami a tabuľky Delta Lake môžu byť čítané externými čítačmi Iceberg. Iceberg tabuľky môžete písať priamo do OneLake alebo vytvárať skratky k Iceberg tabuľkám uloženým externe a OneLake ich sprístupní všetkým Fabric enginom bez manuálnej konverzie. Podobne, akýkoľvek stôl Delta Lake v OneLake je dostupný prostredníctvom služieb kompatibilných s Iceberg, ako je Snowflake.

Ďalšie informácie nájdete v téme Použitie tabuliek Iceberg s onelake.

Pripojte sa na OneLake

K dátam OneLake môžete pristupovať z portálu Fabric, Windows, existujúcich nástrojov Azure alebo z akejkoľvek aplikácie, ktorá podporuje ADLS Gen2 API.

Prieskumník súborov OneLake pre Windows

Dáta OneLake z Windows môžete preskúmať pomocou prieskumníka súborov OneLake pre Windows. Môžete sa pohybovať vo všetkých pracovných priestoroch a položkách údajov, jednoducho nahrávať, sťahovať alebo upravovať súbory rovnako ako v Office. OneLake file explorer zjednodušuje prácu s dátovými jazerami, takže ich môžu používať aj netechnickí obchodní používateľia.

Ďalšie informácie nájdete v téme Prieskumník súborov OneLake.

ADLS Gen2 API a SDK

OneLake podporuje Azure Data Lake Storage (ADLS) Gen2 API a SDK, takže môžete používať existujúce ADLS Gen2 aplikácie. Každý pracovný priestor sa zobrazuje ako kontajner a dátové položky sa zobrazujú ako priečinky v týchto kontajneroch. Ďalšie informácie nájdete v téme Prístup k OneLake a rozhrania API.

Diagram znázorňujúci prístup k údajom OneLake pomocou rozhraní API a súprav SDK.

Keďže OneLake je kompatibilný s ADLS Gen2 aplikáciami, môžete sa pripojiť k OneLake z Azure služieb. Napríklad:

Ochrana a monitorovanie údajov

OneLake obsahuje zabudované funkcie na ochranu vašich dát a poskytuje vám prehľad o ich využívaní.

Obnova po havárii a ochrana údajov

OneLake automaticky chráni vaše dáta zabudovanou redundanciou. V regiónoch, ktoré podporujú zóny dostupnosti, OneLake používa zónovo redundantné úložisko (ZRS) na replikáciu dát naprieč viacerými dátovými centrami. V iných regiónoch používa lokálne redundantné úložisko (LRS). Pre dodatočnú ochranu pred výpadkami v celom regióne môžete povoliť kontinuitu podnikania a obnovu po havárii (BCDR) na kapacite geo-replikácie vašich dát do spárovaného Azure regiónu. OneLake tiež podporuje mäkké vymazanie, ktoré uchováva vymazané súbory sedem dní, takže sa môžete obnoviť po neúmyselných vymazaniach.

Pre viac informácií pozri obnovu po havárii a ochranu údajov pre OneLake.

Diagnostika

OneLake diagnostika poskytuje prehľad o tom, ako sa k dátam pristupuje a používa sa v rámci vášho prostredia Fabric. Keď povolíte diagnostiku na úrovni pracovného priestoru, udalosti prístupu k dátam sa streamujú ako logy do jazerného domu. Môžete sledovať, kto pristupoval k akým údajom, kedy a ako. Toto logovanie pokrýva akcie používateľov v rozhraní Fabric, programatický prístup cez API a analytické enginy, a prístup medzi pracovnými priestormi cez skratky.

Ďalšie informácie nájdete v téme Diagnostika OneLake.