Rýchly štart: Dotazujte a spotrebovávajte dáta OneLake naprieč Microsoft Fabric

V tomto rýchlom štarte použijete tri Fabric enginy na interakciu s rovnakým jazerným stolom. Najprv dotazujete tabuľku pomocou SQL analytics endpointu. Potom vytvoríte Power BI report v režime Direct Lake nad tou istou tabuľkou. Nakoniec čítate tú istú tabuľku zo Spark zápisníka. Tieto kroky spolu ukazujú základný vzorec OneLake: jedna kópia dát, viacero enginov.

OneLake ukladá tabuľkové dáta v otvorenom formáte Delta Parquet na vrchu Azure Data Lake Storage (ADLS) Gen2. Táto zdieľaná základňa umožňuje rôznym Fabric enginom pracovať s rovnakými dátami bez nutnosti ich presúvať alebo formátovať pre každý zážitok. Nástroje a služby podporujúce ADLS Gen2, ako Azure Databricks, Azure Synapse Analytics a vlastné aplikácie, môžu tiež pristupovať k rovnakým dátam mimo Fabric.

Požiadavky

Dotazujte tabuľku pomocou SQL analytics endpointu

Každý lakehouse automaticky získa SQL analytický endpoint. Endpoint číta priamo z Delta tabuliek v OneLake, takže môžete spúšťať T-SQL dotazy na dátach z vášho lakehouse bez kopírovania do samostatného SQL úložiska.

  1. V portáli Fabric otvorte pracovný priestor, kde sa nachádza váš jazerný dom, a vyberte jazerný dom.

  2. V pravom hornom rohu lakehouse vyberte z rozbaľovacieho zoznamu možnosť Analyzovať dáta pomocou>SQL analytics endpointu , aby ste prepli na SQL analytics endpoint toho istého položky.

    Snímka obrazovky portálu Fabric, ktorá ukazuje prechod na SQL analytics endpoint.

  3. V menu SQL analytics endpoint vyberte Nový SQL dotaz.

  4. V editore dotazov spustite nasledujúci dotaz proti tabuľke dim_products :

    Tento dotaz zoskupuje podľa kategórie a podkategórie, aby zobrazil počet produktov a priemernú cenu.

    SELECT
       category,
       subcategory,
       COUNT(*) AS products,
       ROUND(AVG(standard_price), 2) AS avg_price
    FROM (
       SELECT
          product_id,
          category,
          subcategory,
          standard_price,
          ROW_NUMBER() OVER (
             PARTITION BY product_id
             ORDER BY from_date DESC
          ) AS rn
       FROM dbo.dim_products
    ) latest
    WHERE rn = 1
    GROUP BY category, subcategory
    ORDER BY avg_price DESC;
    
  5. Skontrolujte výsledky v paneli výstupu dotazu.

    Screenshot portálu Fabric, ktorý ukazuje výstup SQL dotazu.

Dotazovali ste stôl bez toho, aby ste ho presunuli alebo duplikovali. SQL analytický endpoint číta tie isté Delta súbory v OneLake, ktoré používa lakehouse.

Vytvorte Power BI report v režime Direct Lake

Direct Lake je režim úložiska Power BI, ktorý číta tabuľky Delta z OneLake, takže sémantický model môže poskytovať reporty bez importu alebo duplikácie dát. Direct Lake má dva režimy, ktoré oba čítajú dáta z OneLake: Direct Lake na OneLake a Direct Lake na SQL. Líšia sa v tom, ako sémantický model objavuje tabuľky a vynucuje oprávnenia. Keďže tento rýchly štart začína z SQL analytics endpointu, tok vytvára sémantický model Direct Lake on SQL .

V tejto časti vytvoríte sémantický model a jednoduchú správu nad tou istou dim_products tabuľkou.

Zobrazenie reportu zobrazuje priemernú cenu produktu podľa category, pričom každý pruh je rozdelený .subcategory

  1. V menu koncových bodov SQL analytiky vyberte Nový sémantický model.

    Screenshot portálu Fabric, ktorý ukazuje vytváranie sémantického modelu z SQL analytics endpointu.

  2. Zadajte názov pre sémantický model, napríklad dim_products_model. Vyberte tabuľku dim_products a potom vyberte Potvrdiť.

  3. V menu sémantického modelu vyberte Nová správa.

    Screenshot portálu Fabric, ktorý ukazuje vytváranie reportu zo sémantického modelu.

  4. V skúsenosti s tvorbou správ rozšírte tabuľku dim_productsv dátovom paneli.

  5. V paneli Vizualizácie vyberte Stacked column chart.

    Screenshot portálu Fabric, ktorý ukazuje výber vizuálu stohovaného stĺpcového grafu.

  6. Potiahnite category na os X.

  7. Potiahnite standard_price na os Y, potom nastavte agregáciu na Priemer.

  8. Potiahnite subcategory do Legendy , aby ste každú kategóriu rozdelili do podkategórií.

    Screenshot portálu Fabric, ktorý ukazuje výsledky krokov budovania reportu.

  9. Na páske vyberteUložiť> a uložiť správu do pracovného priestoru.

Správa číta z tej istej Delta tabuľky v OneLake, ktorú ste práve dotazovali pomocou T-SQL. Nevytvorili ste druhú kópiu dát na podporu správy.

Prečítajte si tú istú tabuľku zo Spark notebooku

Fabric notebooky poskytujú tretí engine na rovnakých dátach. Spark číta tabuľku dim_products Delta priamo z OneLake, bez toho, aby prechádzal SQL analytics endpointom alebo sémantickým modelom. Tento krok ukazuje, že engine s úplne iným zásobníkom dotazov pracuje z rovnakých podkladových súborov.

  1. Vráťte sa k jazernému domu, ktorý obsahuje dim_products.

  2. V menu Lakehouse vyberte Analyzovať dáta pomocou>Notebook>New notebook. Zápisník sa otvorí s vaším jazerným domom už pripojeným ako predvoleným jazerným domom.

  3. Do prvej bunky kódu vložte nasledujúci kód PySparku:

    Tento kód používa from_date ako časovú dimenziu a sumarizuje počet produktov a priemernú cenu podľa obdobia a kategórie.

    from pyspark.sql import functions as F
    
    df = spark.read.table("dim_products")
    
    summary = (
       df.groupBy("from_date", "category")
       .agg(
          F.count("*").alias("products"),
          F.round(F.avg("standard_price"), 2).alias("avg_price"),
       )
       .orderBy(F.col("from_date"), F.col("avg_price").desc())
    )
    
    display(summary)
    
  4. Vyberte Spustiť bunku (alebo stlačte Shift+Enter) na spustenie bunky. Výstup ukazuje, ako sa priemerné ceny líšia podľa kategórií naprieč dátumami účinnosti.

    Screenshot portálu Fabric, ktorý ukazuje výsledky kódu zápisníka.

Spark číta súbory Delta priamo v OneLake. Žiadne dáta sa nekopírujú do Spark-špecifického úložiska a tabuľka, ktorú ste dotazovali, je tá istá, ktorá podporuje váš sémantický model. Teraz máte jednu kópiu dát v OneLake, ktorú tri enginy – SQL analytics endpoint, Power BI Direct Lake a Spark – používajú cez otvorené úložisko a formát otvorenej tabuľky, bez presúvania alebo preformátovania dát.

Vyčistenie zdrojov

Ak neplánujete pokračovať v používaní sémantického modelu, reportu a zápisníka, vymažte ich zo svojho pracovného priestoru:

  1. Vo vašom pracovnom priestore prejdite myšou na vytvorený sémantický model, vyberte menu viac možností (...), potom vyberte Vymazať.
  2. Opakujte to pre správu a zápisník vo vašom pracovnom priestore.

Vymazanie správy, sémantického modelu alebo zápisníka neovplyvní podkladový lakehouse a dim_products stôl.