Rychlý start: Dotazujte a spotřebovávejte data OneLake napříč Microsoft Fabric

V tomto rychlém úvodu použijete tři moduly Fabric k práci se stejnou tabulkou v lakehouse. Nejprve dotazujete tabulku pomocí SQL analytics endpointu. Pak vytvoříte Power BI report v režimu Direct Lake nad stejnou tabulkou. Nakonec čtete stejnou tabulku ze Spark notebooku. Tyto kroky společně ukazují základní vzorec OneLake: jedna kopie dat, více enginů.

OneLake ukládá tabulková data v otevřeném formátu Delta Parquet na platformě Azure Data Lake Storage (ADLS) Gen2. Tento sdílený základ umožňuje různým Fabric enginům pracovat se stejnými daty bez nutnosti je přesouvat nebo formátovat pro každou zkušenost. Nástroje a služby podporující ADLS Gen2, jako Azure Databricks, Azure Synapse Analytics a vlastní aplikace, mohou také dosáhnout stejných dat mimo Fabric.

Předpoklady

Dotazujte tabulku pomocí SQL analytics endpointu

Každý lakehouse automaticky získá koncový bod pro analýzu SQL. Endpoint čte přímo z tabulek Delta v OneLake, takže můžete spouštět T-SQL dotazy na svých datech z Lakehouse, aniž byste je museli kopírovat do samostatného SQL úložiště.

  1. V portálu Fabric otevřete pracovní plochu, kde se nachází váš jezerní dom, a vyberte jezerní domek.

  2. V pravém horním rohu lakehouse vyberte z rozevírací nabídky možnost Analyzovat data pomocí>koncového bodu analytiky SQL; tím přepnete na koncový bod analytiky SQL téže položky.

    Screenshot portálu Fabric, který ukazuje přepínání na SQL analytics endpoint.

  3. V menu SQL analytics endpoint vyberte Nový SQL dotaz.

  4. V editoru dotazů spusťte následující dotaz proti tabulce dim_products :

    Tento dotaz seskupuje podle kategorií a podkategorií, aby zobrazil počet produktů a průměrnou cenu.

    SELECT
       category,
       subcategory,
       COUNT(*) AS products,
       ROUND(AVG(standard_price), 2) AS avg_price
    FROM (
       SELECT
          product_id,
          category,
          subcategory,
          standard_price,
          ROW_NUMBER() OVER (
             PARTITION BY product_id
             ORDER BY from_date DESC
          ) AS rn
       FROM dbo.dim_products
    ) latest
    WHERE rn = 1
    GROUP BY category, subcategory
    ORDER BY avg_price DESC;
    
  5. Prohlédněte si výsledky v panelu výstupu dotazu.

    Screenshot portálu Fabric, který ukazuje výstup SQL dotazu.

Dotázali jste se na tabulku, aniž byste ji přesunuli nebo duplikovali. Koncový bod SQL analýz čte stejné soubory Delta uložené v OneLake, které používá lakehouse.

Vytvořte Power BI report v režimu Direct Lake

Direct Lake je režim úložiště Power BI, který čte tabulky Delty z OneLake, takže sémantický model může podávat reporty bez nutnosti importu nebo duplikace dat. Direct Lake má dva režimy, které oba čtou data z OneLake: Direct Lake on OneLake a Direct Lake on SQL. Liší se v tom, jak sémantický model objevuje tabulky a vynucuje oprávnění. Protože tento rychlý start začíná na SQL analytics endpointu, tok vytváří sémantický model Direct Lake on SQL .

V této části vytvoříte sémantický model a jednoduchou zprávu nad stejnou dim_products tabulkou.

Zobrazení sestavy zobrazuje průměrnou cenu produktu podle category, přičemž každý sloupec je rozdělen podle subcategory.

  1. V menu koncových bodů SQL analytics vyberte Nový sémantický model.

    Screenshot portálu Fabric, který ukazuje vytváření sémantického modelu z SQL analytics endpointu.

  2. Zadejte název pro sémantický model, například dim_products_model. Vyberte tabulku dim_products a pak zvolte Potvrdit.

  3. V menu sémantického modelu vyberte Nová zpráva.

    Screenshot portálu Fabric, který ukazuje vytváření reportu ze sémantického modelu.

  4. Při tvorbě reportů rozšířte tabulku dim_productsv datovém panelu.

  5. V panelu Vizualizace vyberte Stacked column chart.

    Snímek obrazovky portálu Fabric, který zobrazuje výběr vizuálu skládaného sloupcového grafu.

  6. Přetáhni category na osu X.

  7. Přetáhněte standard_price na osu Y a nastavte agregaci na průměr.

  8. Přetáhněte subcategory do Legendy a rozdělte každou kategorii do podkategorií.

    Screenshot portálu Fabric, který ukazuje výsledky kroků sestavování reportu.

  9. Na pásu vyberteUložit> a uložte report do svého pracovního prostoru.

Zpráva se čte ze stejné tabulky Delta v OneLake, kterou jste právě dotazovali pomocí T-SQL. Nevytvořil jste druhou kopii dat, abyste reportu poháněl.

Přečti si stejnou tabulku ze Spark notebooku

Notebooky Fabric vám poskytují třetí výpočetní prostředí nad stejnými daty. Spark čte tabulku dim_products Delta přímo z OneLake, aniž by musel procházet SQL analytics endpoint nebo sémantický model. Tento krok ukazuje, že engine s úplně odlišným zásobníkem dotazů pracuje se stejnými základními soubory.

  1. Vraťte se k jezernímu domu, který obsahuje dim_products.

  2. V nabídce lakehouse vyberte Analyzovat data pomocí>Poznámkový blok>Nový poznámkový blok. Sešit se otevře s vaším jezerním domkem už připojeným jako výchozím jezerním domkem.

  3. Do první buňky kódu vložte následující kód PySparku:

    Tento kód používá from_date časovou dimenzi a shrnuje počet produktů a průměrnou cenu podle období a kategorie.

    from pyspark.sql import functions as F
    
    df = spark.read.table("dim_products")
    
    summary = (
       df.groupBy("from_date", "category")
       .agg(
          F.count("*").alias("products"),
          F.round(F.avg("standard_price"), 2).alias("avg_price"),
       )
       .orderBy(F.col("from_date"), F.col("avg_price").desc())
    )
    
    display(summary)
    
  4. Vyberte Spustit buňku (nebo stiskněte Shift+Enter) pro spuštění buňky. Výstup ukazuje, jak se průměrné ceny liší podle kategorií napříč daty účinnosti.

    Screenshot portálu Fabric, který ukazuje výsledky kódu zápisníku.

Spark čte soubory Delty přímo v OneLake. Žádná data nejsou kopírována do úložiště specifického pro Spark a tabulka, kterou jste dotazovali, je stejná, která podporuje váš sémantický model. Nyní máte jednu kopii dat v OneLake, kterou tři enginy – SQL analytics endpoint, Power BI Direct Lake a Spark – používají přes otevřené úložiště a otevřenou tabulku, aniž by data přesouvaly nebo přeformátovaly.

Vyčistěte zdroje

Pokud neplánujete pokračovat v používání sémantického modelu, reportu a zápisníku, smažte je ze svého pracovního prostoru:

  1. Ve svém pracovním prostoru najeďte myší na vytvořený sémantický model, vyberte menu více možností (...), poté vyberte Smazat.
  2. Opakujte to pro zprávu a zápisník ve vašem pracovním prostoru.

Odstranění sestavy, sémantického modelu nebo poznámkového bloku neovlivní podkladový lakehouse ani tabulku dim_products.