Modelování dat ve skladu

Dokončeno

Bez modelování dat musí každá consumer zjistit, které tabulky spolu vzájemně souvisejí, napsat vlastní logiku agregace a odhadnout významy sloupců. Modelování dat tento problém řeší vložením struktury, obchodní logiky a dokumentace přímo do skladu. Ve skladu Microsoft Fabric připravíte data pro srozumitelnost, definujete relace mezi tabulkami, standardizujete přístup prostřednictvím zobrazení a měření a publikujete sémantické modely pro vytváření sestav. Tyto možnosti modelování ovlivňují všechny podřízené prostředí, včetně dotazů T-SQL, sestav Power BI a analýz přirozeného jazyka řízeného AI.

Příprava dat na spotřebu

Před definováním relací nebo přidáním výpočtů je potřeba vyčistit, co uživatelé uvidí. Nezpracované tabulky skladu často obsahují pracovní tabulky, náhradní klíčové sloupce a interní příznaky, které jsou určené pro zpracování ETL, nikoli pro analýzu. Tyto objekty vytvářejí šum při procházení dat uživateli. Příprava skladu na spotřebu znamená zpřístupnění jenom toho, co je relevantní a aby bylo srozumitelné.

V zobrazení modelu můžete provést několik kroků ke zlepšení spotřebitelské zkušenosti:

  • Skryjte interní objekty jako pracovní tabulky, náhradní klíčové sloupce a ETL artefakty, které zaplňují seznam polí.
  • Přejmenujte sloupce na uživatelsky přívětivé názvy, pokud jsou názvy sloupců ve skladu technické nebo zkrácené. Například přejmenujte CustRgn na Customer Region.
  • Do tabulek a sloupců přidejte popisy, aby uživatelé pochopili, co data představují, aniž by se museli odkazovat na externí dokumentaci.

Tyto kroky nejsou důležité jen pro úhlednost. Funkce Copilot v datových agentech Power BI a Fabric IQ závisí na názvech tabulek, názvech sloupců a popisech, aby interpretovaly otázky v přirozeném jazyce a generovaly přesné SQL nebo DAX. Sloupec s názvem Customer Region "Geografická oblast primární adresy zákazníka" vede k lepším výsledkům přirozeného jazyka než CustRgn bez popisu.

S čistými, dobře pojmenovanými tabulkami jste připraveni definovat, jak se tyto tabulky propojují vzájemně.

Principy relací mezi tabulkami

Relace je logické propojení mezi dvěma tabulkami, které umožňuje filtrování, seskupování a agregaci napříč těmito tabulkami. Ve hvězdicovém schématu relace propojují tabulky faktů s tabulkami dimenzí prostřednictvím sdílených klíčových sloupců.

Například sloupec, který existuje v CustomerKey, FactSales a DimCustomer, vytvoří propojení, které umožňuje analýzu prodeje podle atributů zákazníka, jako je oblast, segment nebo typ účtu.

Každá relace má dvě důležité vlastnosti.

  • Kardinalita popisuje, jak řádky ve dvou tabulkách odpovídají. Ve hvězdicovém schématu jsou relace faktů k dimenzím obvykle mnoho na jeden, což znamená, že mnoho řádků faktů se mapuje na jeden řádek dimenze.
  • Směr křížového filtru určuje, jakým způsobem se filtry šíří mezi tabulkami. Jedním směrem, kde dimenze filtruje tabulku faktů, je standardní nastavení pro většinu návrhů hvězdicového schématu, protože udržuje předvídatelné a výkonné chování filtru.

Bez definovaných relací musí každý uživatel, který chce kombinovat data napříč tabulkami, psát explicitní logiku JOIN. Relace eliminují toto opakování tím, že spojení zakódují pouze jednou. Při vytváření sémantického modelu ze skladu tyto relace informují, jak datová agenti Power BI, Copilot a Fabric IQ interpretují data. Datová agenti například používají relace k vygenerování přesných spojení při překladu otázek přirozeného jazyka do SQL.

Poznámka:

Většina datových skladů používá dimenzionální modelování. Vztahy lze vytvořit tak, aby tvořily hvězdicové schéma, což je ideální model pro analýzu. Další informace naleznete v modulu Navrhování dimenzionálních modelů v Microsoft Fabric.

Standardizace přístupu k datům pomocí zobrazení a metrik

Teď, když jsou tabulky čisté a propojené, je dalším krokem poskytnutí spolehlivých a konzistentních způsobů, jak se na tato data dotazovat a vypočítat. Bez standardizace každý tým zapíše vlastní logiku spojení, použije vlastní filtry a definuje vlastní vzorce, což vede ke konfliktu výsledků.

Zobrazení poskytují tuto konzistenci pro uživatele T-SQL. Zobrazení zapouzdřuje logiku spojení, filtry a výběry sloupců do opakovaně použitelného dotazu, na který uživatelé odkazují jako na tabulku. Například zobrazení, které spojuje tabulky faktů a dimenzí, filtruje dokončené objednávky a zobrazuje pouze sloupce, které potřebují analytiki, poskytuje každému T-SQL consumer spolehlivý výchozí bod. Zobrazení také slouží jako stabilní zdroje dat pro sestavy. Místo vytváření sestav přímo na základních tabulkách, které by se mohly změnit, můžete nasměrovat sestavy na zobrazení, která představují konzistentní strukturu.

Míry poskytují stejnou konzistenci pro výpočty DAX. Míra je opakovaně použitelný výraz DAX, který definuje výpočet, jako je celkový, průměrný, poměr nebo počet. Míry vytvoříte přímo v zobrazení modelu skladu tak, že vyberete tabulku a přidáte novou míru. Například míra Total Sales, která sečte sloupec SalesAmount, zajišťuje, že každý spotřebitel používá stejný výpočet.

Protože definice míry žije s daty, stane se jediným zdrojem pravdy pro danou metriku. Když firma změní způsob výpočtu výnosů, aktualizujete metricku na jednom místě místo hledání všech sestav, které obsahují své vlastní vzorce.

Zobrazení a míry společně pokrývají obě strany spotřeby: zobrazení standardizují způsob, jakým uživatelé T-SQL přistupují k datům a dotazují se na ně, zatímco míry standardizují, jak se obchodní výpočty zobrazují v sestavách a řídicích panelech.

Návod

Vzorce DAX a pokročilý návrh měr jsou podrobně popsané v dalších modulech. Zobrazení a uložené procedury najdete v předchozí lekci o dotazování a transformaci dat.

Vytvoření sémantického modelu pro Power BI reportování

S připravenými tabulkami, definovanými relacemi a standardizovanými zobrazeními a mírami je sklad připravený pro následné zpracování sestav. Týmy, které dotazují sklad přímo pomocí T-SQL nebo se připojují prostřednictvím nástrojů třetích stran, můžou pracovat s modelem skladu as-is. Pokud ale chcete vytvářet interaktivní sestavy a řídicí panely Power BI, je dalším krokem vytvoření sémantického modelu.

Sémantické modely vytvořené z skladu Fabric používají režim Direct Lake. Na rozdíl od tradičního režimu importu, který kopíruje data do paměti Power BI, Direct Lake čte data přímo ze souborů OneLake Parquet. To znamená, že sestavy odrážejí nejnovější data skladu bez nutnosti plánovaných aktualizací. Také to znamená, že se vyhnete nutné režii ukládání a zpracování potřebnou k zachování samostatné kopie dat.

Snímek obrazovky se sestavou Power BI

Návod

Vzory návrhu a škálovatelnosti sémantických modelů jsou podrobněji popsány ve škálovatelných sémantických modelech návrhu. Tato lekce se zaměřuje na modelování dat v samotném skladu.