Quickstart: Foresøg og forbrug OneLake-data på tværs af Microsoft Fabric

I denne quickstart bruger du tre Fabric-motorer til at interagere med det samme lakehouse-bord. Først forespørger du tabellen ved at bruge SQL analytics-endpointet. Derefter bygger du en Power BI-rapport i Direct Lake-tilstand over den samme tabel. Endelig læser du den samme tabel fra en Spark-notesbog. Sammen viser disse trin det centrale OneLake-mønster: én kopi af data, flere motorer.

OneLake gemmer tabulære data i åbent Delta Parquet-format oven på Azure Data Lake Storage (ADLS) Gen2. Den fælles fundament gør det muligt for forskellige Fabric-motorer at arbejde med de samme data uden at skulle flytte eller omformatere dem for hver oplevelse. Værktøjer og tjenester, der understøtter ADLS Gen2, såsom Azure Databricks, Azure Synapse Analytics og brugerdefinerede applikationer, kan også nå de samme data fra eksterne Fabric.

Forudsætninger

Forespørg tabellen ved at bruge SQL analytics-endpointet

Hvert lakehouse får automatisk et SQL-analyse-endpoint. Endpointet læser direkte fra Delta-tabellerne i OneLake, så du kan køre T-SQL-forespørgsler mod dine lakehouse-data uden at kopiere dem til en separat SQL-butik.

  1. I Fabric-portalen åbner du arbejdsområdet, der indeholder dit søhus, og vælger søhuset.

  2. I øverste højre hjørne af lakehouset vælger du Analyser data med>SQL analytics-endpoint fra dropdown-menuen for at skifte til SQL-analytics-endpointet for det samme element.

    Et screenshot af Fabric-portalen, der viser skift til SQL-analyse-endpointet.

  3. I SQL analytics endpoint-menuen vælger du Ny SQL-forespørgsel.

  4. I forespørgselseditoren kør følgende forespørgsel mod tabellen dim_products :

    Denne forespørgsel grupperes efter kategori og underkategori for at vise produktantal og gennemsnitspris.

    SELECT
       category,
       subcategory,
       COUNT(*) AS products,
       ROUND(AVG(standard_price), 2) AS avg_price
    FROM (
       SELECT
          product_id,
          category,
          subcategory,
          standard_price,
          ROW_NUMBER() OVER (
             PARTITION BY product_id
             ORDER BY from_date DESC
          ) AS rn
       FROM dbo.dim_products
    ) latest
    WHERE rn = 1
    GROUP BY category, subcategory
    ORDER BY avg_price DESC;
    
  5. Gennemgå resultaterne i forespørgselsoutput-panelet.

    Et screenshot af Fabric-portalen, der viser outputtet af en SQL-forespørgsel.

Du foresøgte tabellen uden at flytte eller duplikere den. SQL-analyse-endpointet læser de samme Delta-filer i OneLake, som lakehouse bruger.

Byg en Power BI-rapport i Direct Lake-tilstand

Direct Lake er en Power BI-lagringstilstand, der læser Delta-tabeller fra OneLake, så en semantisk model kan levere rapporter uden at importere eller duplikere dataene. Direct Lake har to tilstande, der begge læser data fra OneLake: Direct Lake på OneLake og Direct Lake på SQL. De adskiller sig i, hvordan den semantiske model opdager tabeller og håndhæver tilladelser. Fordi denne quickstart starter fra SQL-analyse-endpointet, opretter flowet en Direct Lake on SQL semantisk model.

I dette afsnit bygger du en semantisk model og en simpel rapport over den samme dim_products tabel.

Rapportvisningen viser gennemsnitlig produktpris med category, hvor hver bjælke deles med subcategory.

  1. Fra SQL analytics endpoint-menuen vælger du Ny semantisk model.

    Et screenshot af Fabric-portalen, der viser oprettelsen af en semantisk model fra SQL-analyse-endpointet.

  2. Indtast et navn til den semantiske model, som dim_products_model. Vælg tabellen dim_products , og vælg derefter Bekræft.

  3. Fra menuen for semantisk model vælger du Ny rapport.

    Et screenshot af Fabric-portalen, der viser, hvordan man opretter en rapport fra den semantiske model.

  4. I rapportforfattelsesoplevelsen skal du udvide dim_products tabellen i Data-panelet .

  5. I panelet Visualiseringer skal du vælge Stablet kolonnediagram.

    Et screenshot af Fabric-portalen, der viser, hvordan man vælger det stablede kolonnediagram.

  6. Træk category til X-aksen.

  7. Træk standard_price til Y-aksen, og sæt derefter aggregeringen til Gennemsnit.

  8. Træk subcategory til Legend for at opdele hver kategori i underkategorier.

    Et screenshot af Fabric-portalen, der viser resultaterne af rapportens opbygningstrin.

  9. På båndet vælger du Filgem> og gemmer rapporten i dit arbejdsområde.

Rapporten læses fra den samme Delta-tabel i OneLake, som du lige har forespurgt med T-SQL. Du lavede ikke en anden kopi af dataene til at drive rapporten.

Læs den samme tabel fra en Spark-notesbog

Fabric-notebooks giver dig en tredje motor over de samme data. Spark læser dim_products Delta-tabellen direkte fra OneLake uden at gå igennem SQL-analyse-endpointet eller den semantiske model. Dette trin viser, at en motor med en helt anden forespørgselsstak arbejder ud fra de samme underliggende filer.

  1. Gå tilbage til søhuset, der indeholder dim_products.

  2. I lakehouse-menuen vælger du Analyser data med>notesbog.>Ny notesbog. Notesbogen åbner med, at dit søhus allerede er tilknyttet som standard søhus.

  3. I den første kodecelle indsættes følgende PySpark-kode:

    Denne kode bruger from_date som tidsdimension og opsummerer produktantal og gennemsnitspris efter periode og kategori.

    from pyspark.sql import functions as F
    
    df = spark.read.table("dim_products")
    
    summary = (
       df.groupBy("from_date", "category")
       .agg(
          F.count("*").alias("products"),
          F.round(F.avg("standard_price"), 2).alias("avg_price"),
       )
       .orderBy(F.col("from_date"), F.col("avg_price").desc())
    )
    
    display(summary)
    
  4. Vælg Kør celle (eller tryk Shift+Enter) for at køre cellen. Outputtet viser, hvordan gennemsnitspriserne varierer efter kategori på ikrafttrædelsesdatoer.

    Et screenshot af Fabric-portalen, der viser resultaterne af notesbogskoden.

Spark læser Delta-filerne direkte i OneLake. Ingen data kopieres til en Spark-specifik butik, og den tabel, du forespørgede, er den samme, som understøtter din semantiske model. Du har nu én kopi af data i OneLake, som tre motorer – SQL-analyse-endpointet, Power BI Direct Lake og Spark – bruger gennem åben lagring og et åbent tabelformat, uden at flytte eller omformatere dataene.

Fjerne ressourcer

Hvis du ikke planlægger at fortsætte med at bruge den semantiske model, rapport og notesbog, så slet dem fra dit arbejdsområde:

  1. I dit arbejdsområde skal du holde musen over den semantiske model, du har oprettet, og vælge menuen flere muligheder (...), og derefter vælge Slet.
  2. Gentag for rapporten og notesbogen i dit arbejdsområde.

At slette rapporten, den semantiske model eller notesbogen påvirker ikke den underliggende lakehouse og dim_products tabellen.