Quickstart: Kueri dan konsumsi data OneLake di seluruh Microsoft Fabric

Dalam panduan memulai cepat ini, Anda menggunakan tiga mesin Fabric untuk berinteraksi dengan tabel lakehouse yang sama. Pertama, Anda melakukan query pada tabel menggunakan endpoint SQL analytics. Kemudian, Anda membuat laporan Power BI dalam mode Direct Lake di atas tabel yang sama. Akhirnya, Anda membaca tabel yang sama dari buku catatan Spark. Secara keseluruhan, langkah-langkah ini menunjukkan pola inti OneLake: satu salinan data, beberapa mesin.

OneLake menyimpan data tabular dalam format Delta Parquet terbuka di atas Azure Data Lake Storage (ADLS) Gen2. Fondasi bersama ini memungkinkan mesin Fabric yang berbeda bekerja dengan data yang sama tanpa harus memindahkannya atau memformat ulang untuk setiap pengalaman. Alat dan layanan yang mendukung ADLS Gen2, seperti Azure Databricks, Azure Synapse Analytics, dan aplikasi kustom, juga dapat mengakses data yang sama dari luar Fabric.

Prasyarat

Buat kueri pada tabel dengan menggunakan endpoint analitik SQL

Setiap lakehouse secara otomatis mendapatkan endpoint analitik SQL. Endpoint tersebut membaca langsung dari tabel Delta di OneLake, sehingga Anda dapat menjalankan kueri T-SQL terhadap data lakehouse tanpa harus menyalinnya ke penyimpanan SQL yang terpisah.

  1. Di portal Fabric, buka ruang kerja yang berisi lakehouse Anda dan pilih lakehouse tersebut.

  2. Di sudut kanan atas lakehouse, pilih Analisis data dengan>endpoint analitik SQL dari menu drop-down untuk beralih ke endpoint analitik SQL untuk item yang sama.

    Tangkapan layar portal Fabric yang menunjukkan saat beralih ke endpoint SQL analytics.

  3. Pada menu endpoint SQL analytics, pilih Kueri SQL Baru.

  4. Di editor kueri, jalankan kueri berikut terhadap tabel dim_products:

    Kueri ini mengelompokkan berdasarkan kategori dan subkategori untuk menampilkan jumlah produk dan harga rata-rata.

    SELECT
       category,
       subcategory,
       COUNT(*) AS products,
       ROUND(AVG(standard_price), 2) AS avg_price
    FROM (
       SELECT
          product_id,
          category,
          subcategory,
          standard_price,
          ROW_NUMBER() OVER (
             PARTITION BY product_id
             ORDER BY from_date DESC
          ) AS rn
       FROM dbo.dim_products
    ) latest
    WHERE rn = 1
    GROUP BY category, subcategory
    ORDER BY avg_price DESC;
    
  5. Tinjau hasil di panel output kueri.

    Tangkapan layar portal Fabric yang menunjukkan output dari query SQL.

Anda melakukan query pada tabel tanpa memindahkan atau menduplikasinya. Endpoint SQL analytics tersebut membaca file Delta yang sama di OneLake yang digunakan oleh lakehouse.

Buat laporan Power BI dalam mode Direct Lake

Direct Lake adalah mode penyimpanan Power BI yang membaca tabel Delta dari OneLake, sehingga model semantik dapat menyajikan laporan tanpa mengimpor atau menduplikasi data. Direct Lake memiliki dua mode yang keduanya membaca data dari OneLake: Direct Lake di OneLake dan Direct Lake di SQL. Mereka berbeda dalam cara model semantik menemukan tabel dan menegakkan izin. Karena quickstart ini dimulai dari endpoint SQL analytics, alur ini menciptakan model semantik Direct Lake pada SQL .

Di bagian ini, Anda membangun model semantik dan laporan sederhana di atas tabel yang sama dim_products .

Tampilan laporan menampilkan harga rata-rata produk berdasarkan category, dengan setiap batang dibagi berdasarkan subcategory.

  1. Dari menu endpoint SQL analytics, pilih Model semantik baru.

    Tangkapan layar portal Fabric yang menunjukkan pembuatan model semantik dari endpoint SQL analytics.

  2. Masukkan nama untuk model semantik, seperti dim_products_model. Pilih dim_products tabel, lalu pilih Konfirmasi.

  3. Dari menu model semantik, pilih Laporan baru.

    Tangkapan layar portal Fabric yang menunjukkan pembuatan laporan dari model semantik.

  4. Dalam pengalaman penulisan laporan, perluas tabel dim_products di panel Data.

  5. Di panel Visualisasi , pilih Stacked column chart.

    Tangkapan layar portal Fabric yang menunjukkan proses pemilihan visual grafik kolom bertumpuk.

  6. Seret category ke sumbu X.

  7. Seret standard_price ke sumbu Y, lalu atur agregasi ke Rata-rata.

  8. Seret subcategory ke Legenda untuk membagi setiap kategori menjadi subkategori.

    Tangkapan layar portal Fabric yang menunjukkan hasil langkah-langkah pembuatan laporan.

  9. Pada pita, pilih File>Save dan simpan laporan ke workspace Anda.

Laporan tersebut berasal dari tabel Delta yang sama di OneLake yang baru saja Anda kueri dengan T-SQL. Anda tidak membuat salinan kedua dari data untuk menjalankan laporan tersebut.

Baca tabel yang sama dari notebook Spark

Buku catatan Fabric menyediakan mesin pemrosesan ketiga atas data yang sama. Spark membaca dim_products tabel Delta langsung dari OneLake, tanpa melalui endpoint analitik SQL atau model semantik. Langkah ini menunjukkan bahwa mesin dengan stack kueri yang benar-benar berbeda bekerja dari file dasar yang sama.

  1. Kembali ke lakehouse yang berisi dim_products.

  2. Pada menu lakehouse, pilih Analisis data dengan>Notebook>Notebook Baru. Notebook akan terbuka dengan lakehouse Anda yang sudah terlampir sebagai lakehouse default.

  3. Di sel kode pertama, tempelkan kode PySpark berikut:

    Kode ini digunakan from_date sebagai dimensi waktu dan merangkum jumlah produk serta harga rata-rata berdasarkan periode dan kategori.

    from pyspark.sql import functions as F
    
    df = spark.read.table("dim_products")
    
    summary = (
       df.groupBy("from_date", "category")
       .agg(
          F.count("*").alias("products"),
          F.round(F.avg("standard_price"), 2).alias("avg_price"),
       )
       .orderBy(F.col("from_date"), F.col("avg_price").desc())
    )
    
    display(summary)
    
  4. Pilih Jalankan sel (atau tekan Shift+Enter) untuk menjalankan sel. Output menunjukkan bagaimana harga rata-rata berbeda menurut kategori pada tanggal efektif.

    Tangkapan layar portal Fabric yang menunjukkan hasil kode notebook.

Spark membaca file Delta langsung di OneLake. Tidak ada data yang disalin ke store khusus Spark, dan tabel yang Anda kueri adalah tabel yang sama dengan yang mendukung model semantik Anda. Sekarang Anda memiliki satu salinan data di OneLake yang digunakan oleh tiga mesin—endpoint SQL analytics, Power BI Direct Lake, dan Spark—melalui open storage dan format open table, tanpa memindahkan atau memformat ulang data.

Membersihkan sumber daya

Jika Anda tidak berencana untuk terus menggunakan model semantik, laporan, dan buku catatan, hapus mereka dari workspace Anda:

  1. Di ruang kerja Anda, arahkan kursor ke model semantik yang Anda buat dan pilih menu opsi lainnya (...), lalu pilih Hapus.
  2. Ulangi hal yang sama untuk laporan dan buku catatan di ruang kerja Anda.

Menghapus laporan, model semantik, atau buku catatan tidak memengaruhi lakehouse dan dim_products tabel yang mendasarinya.