Início Rápido: Consultar e consumir dados do OneLake em todo o Microsoft Fabric

Neste guia de início rápido, você usa três mecanismos do Fabric para interagir com a mesma tabela do lakehouse. Primeiro, você consulta a tabela usando o endpoint de análise SQL. Depois, você constrói um relatório Power BI no modo Direct Lake sobre essa mesma tabela. Finalmente, você lê a mesma tabela a partir de um notebook do Spark. Juntos, esses passos mostram o padrão central do OneLake: uma cópia dos dados, múltiplos motores.

OneLake armazena dados tabulares em formato aberto Delta Parquet sobre o Azure Data Lake Storage (ADLS) Gen2. Essa base compartilhada permite que diferentes engines de Fabric trabalhem com os mesmos dados sem precisar movê-los ou reformatá-los para cada experiência. Ferramentas e serviços que suportam ADLS Gen2, como Azure Databricks, Azure Synapse Analytics e aplicações personalizadas, também podem acessar os mesmos dados de fora do Fabric.

Pré-requisitos

Consulte a tabela usando o endpoint de análise SQL

Todo lakehouse recebe automaticamente um endpoint de análise SQL. O endpoint lê diretamente das tabelas Delta no OneLake, então você pode rodar consultas T-SQL nos seus dados do Lakehouse sem precisar copiá-los para um armazenamento SQL separado.

  1. No portal Fabric, abra o espaço de trabalho que contém sua casa do lago e selecione a casa do lago.

  2. No canto superior direito do lakehouse, selecione Analisar dados com>o endpoint de análise SQL no menu suspenso para alternar para o endpoint de análise SQL do mesmo item.

    Uma captura de tela do portal Fabric que mostra a mudança para o endpoint de análise SQL.

  3. No menu do endpoint de análises SQL, selecione Nova consulta SQL.

  4. No editor de consultas, execute a seguinte consulta contra a dim_products tabela:

    Esta consulta agrupa por categoria e subcategoria para mostrar a contagem de produtos e o preço médio.

    SELECT
       category,
       subcategory,
       COUNT(*) AS products,
       ROUND(AVG(standard_price), 2) AS avg_price
    FROM (
       SELECT
          product_id,
          category,
          subcategory,
          standard_price,
          ROW_NUMBER() OVER (
             PARTITION BY product_id
             ORDER BY from_date DESC
          ) AS rn
       FROM dbo.dim_products
    ) latest
    WHERE rn = 1
    GROUP BY category, subcategory
    ORDER BY avg_price DESC;
    
  5. Revise os resultados no painel de saída da consulta.

    Uma captura de tela do portal Fabric que mostra a saída de uma consulta SQL.

Você consultava a tabela sem movê-la ou duplicá-la. O endpoint de análise SQL leu os mesmos arquivos Delta no OneLake que o lakehouse usa.

Construa um relatório Power BI no modo Direct Lake

Direct Lake é um modo de armazenamento Power BI que lê tabelas Delta do OneLake, então um modelo semântico pode fornecer relatórios sem importar ou duplicar os dados. O Direct Lake possui dois modos que ambos leem dados do OneLake: Direct Lake no OneLake e Direct Lake no SQL. Eles diferem na forma como o modelo semântico descobre tabelas e aplica permissões. Como esse início rápido começa no endpoint de análise SQL, o fluxo cria um Direct Lake no modelo semântico SQL .

Nesta seção, você constrói um modelo semântico e um relatório simples sobre a mesma dim_products tabela.

A visualização do relatório mostra o preço médio do produto por category, com cada barra dividida por subcategory.

  1. No menu endpoint de análise SQL, selecione Novo modelo semântico.

    Uma captura de tela do portal Fabric que mostra a criação de um modelo semântico a partir do endpoint de análise SQL.

  2. Insira um nome para o modelo semântico, como dim_products_model. Selecione a dim_products tabela e depois selecione Confirmar.

  3. No menu semântico do modelo, selecione Novo relatório.

    Uma captura de tela do portal Fabric que mostra a criação de um relatório a partir do modelo semântico.

  4. Na experiência de criação de relatórios, expanda a tabela dim_products no painel Dados.

  5. No painel de Visualizações , selecione Quadro de colunas empilhado.

    Uma captura de tela do portal Fabric mostrando a seleção do visual de gráfico de colunas empilhadas.

  6. Arraste category para o eixo X.

  7. Arraste standard_price para o eixo Y, depois defina a agregação para Média.

  8. Arraste subcategory para Lenda para dividir cada categoria em subcategorias.

    Uma captura de tela do portal Fabric que mostra os resultados das etapas de construção do relatório.

  9. Na faixa de opções, selecione Arquivo>Salvar e salve o relatório no seu espaço de trabalho.

O relatório lê os dados da mesma tabela Delta no OneLake que você acabou de consultar com T-SQL. Você não criou uma segunda cópia dos dados para alimentar o relatório.

Leia a mesma tabela de um caderno da Spark

Os notebooks do Fabric oferecem um terceiro mecanismo sobre os mesmos dados. O Spark lê a dim_products tabela Delta diretamente do OneLake, sem passar pelo endpoint de análise SQL ou pelo modelo semântico. Essa etapa mostra que um motor com uma pilha de consultas completamente diferente funciona a partir dos mesmos arquivos subjacentes.

  1. Volte para a casa do lago que contém dim_products.

  2. No menu do lakehouse, selecione Analisar dados com>Notebook>Novo notebook. O caderno começa com sua casa do lago já anexada como a casa padrão do lago.

  3. Na primeira célula de código, cole o seguinte código PySpark:

    Este código utiliza from_date como dimensão temporal e resume a contagem de produtos e o preço médio por período e categoria.

    from pyspark.sql import functions as F
    
    df = spark.read.table("dim_products")
    
    summary = (
       df.groupBy("from_date", "category")
       .agg(
          F.count("*").alias("products"),
          F.round(F.avg("standard_price"), 2).alias("avg_price"),
       )
       .orderBy(F.col("from_date"), F.col("avg_price").desc())
    )
    
    display(summary)
    
  4. Selecione Executar célula (ou pressione Shift+Enter) para executar a célula. O resultado mostra como os preços médios variam por categoria ao longo das datas de vigência.

    Uma captura de tela do portal Fabric que mostra os resultados do código do notebook.

O Spark lê diretamente os arquivos Delta no OneLake. Nenhum dado é copiado para um armazenamento específico do Spark, e a tabela que você consultou é a mesma que sustenta seu modelo semântico. Agora você tem uma cópia dos dados no OneLake que três engines — o endpoint de análise SQL, Power BI Direct Lake e Spark — usam por meio de armazenamento aberto e formato de tabela aberta, sem mover ou reformatar os dados.

Limpar os recursos

Se você não pretende continuar usando o modelo semântico, relatório e caderno, exclua-os do seu espaço de trabalho:

  1. No seu espaço de trabalho, passe o mouse sobre o modelo semântico que você criou e selecione o menu mais opções (...), depois selecione Excluir.
  2. Repita isso para o relatório e o notebook em seu espaço de trabalho.

Excluir o relatório, o modelo semântico ou o notebook não afeta o lakehouse subjacente nem a tabela dim_products.