Transformar arquivos estruturados em tabelas Delta

Use transformações de atalho para converter arquivos estruturados em tabelas Delta que podem ser consultadas. Se os dados de origem já estiverem em um formato tabular como CSV, Parquet, JSON ou Excel, as transformações de arquivo copiarão e converterão automaticamente esses dados no formato Delta Lake para que você possa consultá-los usando SQL, Spark ou Power BI sem criar pipelines ETL.

Para arquivos de texto não estruturados que precisam de processamento de IA, como resumo, tradução ou análise de sentimento, consulte as transformações de atalho (alimentadas por IA).

As transformações de atalho permanecem sempre em sincronia com os dados de origem. A computação do Fabric Spark executa a transformação e copia os dados referenciados por um atalho do OneLake em uma tabela Delta gerenciada. Com o tratamento automático de esquemas, recursos de nivelamento profundo e suporte para vários formatos de compactação, as transformações de atalho eliminam a complexidade de criar e manter pipelines ETL.

Por que usar transformações de atalho?

  • Conversão automática – O Fabric copia e converte arquivos de origem no formato Delta sem orquestração manual de pipeline.
  • Sincronização frequente – o Fabric sonda o atalho a cada dois minutos e sincroniza as alterações.
  • Descoberta de pasta recursiva – O Fabric atravessa automaticamente subpastas para detectar e transformar arquivos em toda a hierarquia de diretório.
  • Saída do Delta Lake – a tabela resultante é compatível com qualquer mecanismo do Apache Spark.
  • Governança herdada – o atalho herda a linhagem do OneLake, as permissões e as políticas do Microsoft Purview.

Pré-requisitos

Requisito Detalhes
SKU do Fabric Capacidade ou teste que suporta cargas de trabalho do Lakehouse.
Dados de origem Uma pasta que contém arquivos CSV, Parquet, JSON ou Excel homogêneos.
Função do espaço de trabalho Colaborador ou superior.

Formatos de arquivo com suporte

As transformações de atalho funcionam com pastas de qualquer fonte de dados compatível com atalhos no OneLake.

Formato do arquivo de origem Extensões com suporte Tipos de compactação com suporte Tipo de atalho com suporte Observações
CSV (UTF-8, UTF-16) .csv, .txt (delimitador), .tsv (separado por tabulação), .psv (separado por barra vertical) .csv.gz, .csv.bz2 Atalho de tabela .csv.zip e .csv.snappy não são suportados.
Parquet .parquet .parquet.snappy, .parquet.gzip, .parquet.lz4, , .parquet.brotli.parquet.zstd Atalho de tabela Nenhum.
JSON .json, .jsonl, .ndjson .json.gz, .json.bz2, .jsonl.gz, .ndjson.gz, .jsonl.bz2, , .ndjson.bz2 Atalho de tabela .json.zip e .json.snappy não são suportados.
Excel .xlsx, .xls Não aplicável Atalho de tabela ou atalho de esquema Atalhos de tabela combinam planilhas em uma tabela Delta. Os atalhos de esquema criam uma tabela Delta para cada planilha. .xls (formato binário herdado) é suportado de forma limitada; .xlsx é o formato recomendado.

Observação

As transformações de arquivo do Excel estão atualmente em versão prévia. As transformações CSV, Parquet e JSON geralmente estão disponíveis.

Criar um atalho de tabela com a transformação de dados

Um atalho de tabela cria uma tabela Delta na pasta Tabelas de um lakehouse. Use-o para transformar arquivos CSV, Parquet, JSON ou Excel.

Para arquivos do Excel com várias planilhas, um atalho de tabela combina as planilhas selecionadas em uma tabela Delta. Se você precisar de uma tabela Delta por planilha, crie um atalho de esquema .

  1. Em seu lakehouse, clique com o botão direito do mouse em um esquema na pasta Tabelas e selecione Novo atalho de tabela. Escolha sua fonte de atalho, como Azure Data Lake, Armazenamento de Blobs do Azure, Dataverse, Amazon S3, GCP, SharePoint ou OneDrive.

    Captura de tela que mostra a criação de

  2. Selecione a pasta com seus arquivos CSV, Parquet ou JSON ou selecione a pasta que contém seus arquivos .xlsx.

  3. Na etapa Transformar , defina as configurações para a conversão Delta:

    • Arquivos CSV:

      • Delimitador – selecione o caractere usado para separar colunas, como vírgula, ponto-e-vírgula, barra vertical, tabulação, ampersand ou espaço.
      • Primeira linha como cabeçalhos – indique se a primeira linha contém nomes de coluna.
    • Arquivos do Excel:

      • Primeira linha como cabeçalhos – indique se a primeira linha contém nomes de coluna.
      • Planilhas a serem incluídas – selecione todas as planilhas ou apenas um subconjunto de planilhas. Você pode selecionar planilhas por nome, por índice ou usando padrões curinga (por exemplo, Sales_* corresponde a planilhas como Sales_Q1 e Sales_2026). Correspondência curinga não diferencia maiúsculas de minúsculas.
  4. Revise a configuração de atalho. Na etapa de atalhos de visualização , você também pode definir essas configurações antes de selecionar Criar:

    • Nome do atalho – selecione o ícone de lápis para editar o nome do atalho.
    • Incluir subpastas – habilitar o processamento recursivo de arquivos em subdiretórios aninhados. Essa opção é selecionada por padrão para novas transformações. Desmarque a caixa de seleção se você quiser processar apenas a pasta de nível superior.
  5. Acompanhe as atualizações e visualize logs no Hub de Monitoramento de Atalhos.

A computação do Fabric Spark cria a tabela Delta e mostra o progresso no painel Gerenciar atalho .

Para arquivos do Excel, a tabela Delta resultante inclui __filepath__ e __sheetname__ colunas de metadados para que você possa rastrear cada linha de volta para seu arquivo de origem e planilha.

Criar um atalho para um esquema com transformação de dados

Um atalho de esquema cria várias tabelas Delta que aparecem sob um novo esquema na pasta Tabelas de um lakehouse. Use-a quando uma pasta de trabalho do Excel tiver várias planilhas e você quiser uma tabela Delta por planilha.

Os atalhos de esquema com a transformação de dados estão disponíveis atualmente apenas para arquivos do Excel (.xlsx). Eles também exigem um lakehouse com schemas habilitados. Para obter mais informações, consulte esquemas Lakehouse.

  1. No lakehouse, clique com o botão direito do mouse na pasta Tabelas e selecione Novo atalho de esquema.

    Captura de tela que mostra a criação de 'atalho de esquema'.

  2. Selecione a fonte de dados para esse atalho e navegue até a pasta que contém seus .xlsx arquivos.

  3. Na etapa Transformar , defina as configurações para a conversão Delta:

    • Primeira linha como cabeçalhos – indique se a primeira linha contém nomes de coluna.
    • Planilhas a serem incluídas – selecione todas as planilhas ou apenas um subconjunto de planilhas. Você pode selecionar planilhas por nome, por índice ou usando padrões curinga.

    Captura de tela que mostra as opções de transformação para um atalho de esquema.

  4. Revise a configuração de atalho. Na etapa de atalhos de visualização , você também pode definir essas configurações antes de selecionar Criar:

    • Nome do atalho – selecione o ícone de lápis para editar o nome do atalho.
    • Incluir subpastas – habilitar o processamento recursivo de arquivos em subdiretórios aninhados. Essa opção é selecionada por padrão para novas transformações. Desmarque a caixa de seleção se você quiser processar apenas a pasta de nível superior.
  5. Acompanhe as atualizações e visualize logs no Hub de Monitoramento de Atalhos.

A computação do Fabric Spark cria tabelas Delta separadas para as planilhas selecionadas e as mantém sincronizadas com os arquivos de origem. Os nomes das planilhas são automaticamente higienizados para nomes de tabela válidos. Por exemplo, uma planilha nomeada Sales Data (Q1) torna-se Sales_Data_Q1.

Como funciona a sincronização

Após a carga inicial, a computação do Fabric Spark:

  • Sonda o alvo de atalho a cada dois minutos.
  • Detecta arquivos novos ou modificados e acrescenta ou substitui linhas adequadamente.
  • Detecta arquivos excluídos e remove linhas correspondentes.

Quando o suporte à subpasta está habilitado, o sistema descobre e processa arquivos recursivamente em todos os subdiretórios aninhados dentro da pasta de destino.

Monitorar e solucionar problemas

As transformações de atalho incluem monitoramento e tratamento de erros para ajudá-lo a controlar o status da ingestão e diagnosticar problemas.

  1. Abra o lakehouse e clique com o botão direito do mouse no atalho que alimenta sua transformação.

  2. Selecione Gerenciar atalho.

  3. No painel de detalhes, você pode exibir:

    • Status – Último resultado da verificação e estado de sincronização atual.

    • Histórico de atualizações – lista cronológica de operações de sincronização com contagens de linhas e quaisquer detalhes de erro.

    • Incluir subpastas – indica se a transformação de subpasta está habilitada (Sim ou Não).

      Captura de tela que mostra o

  4. Exiba mais detalhes nos logs para solucionar problemas.

    Captura de tela que mostra como acessar o

Limitações

As limitações a seguir se aplicam atualmente a transformações de atalho.

Limitações gerais

  • Formato de origem: Há suporte para arquivos CSV, JSON, Parquet e Excel.
  • Consistência do esquema de arquivo: Os arquivos devem compartilhar um esquema idêntico.
  • Disponibilidade do espaço de trabalho: Disponível apenas em itens do Lakehouse (não em armazéns de dados ou bases de dados KQL).
  • Operações de gravação: As transformações são otimizadas para leitura. Não há suporte para instruções DIRECT MERGE INTO ou DELETE na tabela de destino de transformação.
  • Disponibilidade de atalho de esquema: Os atalhos de esquema para transformações de arquivo só dão suporte a arquivos do Excel.

Limitações de CSV

  • Tipos de dados sem suporte: Tipos lógicos complexos – MAP/LIST/STRUCT, binário bruto.

Limitações de JSON

  • Nivelamento do tipo de dados de matriz: O tipo de dados de matriz é mantido na tabela Delta e é acessível com Spark SQL e PySpark. Para outras transformações, use o Fabric Materialized Lake Views para a camada de prata.
  • Profundidade de nivelamento: As estruturas aninhadas são achatadas em até cinco níveis de profundidade. O aninhamento mais profundo requer pré-processamento.

Limitações do Excel

  • Intervalo de células: Os dados são sempre lidos a partir da célula A1. Pastas de trabalho em que os dados começam em uma célula diferente ou usam tabelas ou intervalos nomeados não podem ser alvo.
  • Ignorar linhas: Banners de título, preâmbulos de metadados e resumos de rodapé, acima ou abaixo dos dados efetivos, não podem ser excluídos. Eles são ingeridos como linhas de dados.
  • Inferência de esquema: A inferência de esquema está sempre habilitada para arquivos do Excel. Identificadores com zeros à esquerda (por exemplo, códigos de CEP como 02134 ou IDs de funcionário como 001245) são convertidos em inteiros, o que remove os zeros à esquerda.
  • Planilhas ocultas: Todas as planilhas, incluindo planilhas ocultas e do sistema, são processadas, a menos que sejam explicitamente filtradas por nome ou índice.
  • Formatação de moeda: Células formatadas em moeda (por exemplo, $1,234.56) são convertidas em valores numéricos simples. O símbolo de moeda é despojado.
  • Rótulos de confidencialidade: Pastas de trabalho com rótulos de confidencialidade do Microsoft Purview não podem ser processadas.
  • Linhas corrompidas: O leitor do Excel não dá suporte ao isolamento de registro corrompido. Linhas corrompidas ou com incompatibilidade de tipo em uma planilha não podem ser isoladas e registradas separadamente.
  • Limite da planilha: Arquivos com mais de 25 planilhas são ignorados.
  • Formato herdado:.xls (formato binário herdado) é suportado no limite do possível e pode ter uma precisão reduzida para formatação complexa. .xlsx é o formato recomendado.
  • Avaliação da fórmula: O Spark lê o valor armazenado em cache das células de fórmula. Se a pasta de trabalho não tiver sido salva com valores calculados, as células de fórmula poderão parecer vazias ou obsoletas.

Limitações de subpastas

  • Disponível apenas para novas transformações. As transformações existentes não podem habilitar o suporte a subpastas.
  • Depois que o suporte à subpasta estiver habilitado, ele não poderá ser desabilitado.
  • Os atalhos aninhados dentro da pasta de destino não são seguidos. Somente pastas físicas e arquivos são processados.
  • Não há suporte para inclusão seletiva ou exclusão de subpastas específicas.
  • As pastas aninhadas não funcionam com atalhos do SharePoint.

Use o Roteiro de Malha e o Blog de Atualizações do Fabric para saber mais sobre novos recursos e versões.

Limpeza

Para interromper a sincronização, exclua a transformação de atalho do Lakehouse Explorer.

Excluir a transformação não remove os arquivos subjacentes.