Mover um ficheiro de preparação de dados visuais para produção

Cada ficheiro de preparação de dados visuais que constrói no Lakeflow Designer é suportado por código pronto para produção e armazenado como um caderno chamado <name>.designer.ipynb. Podes transferi-lo para produção com as mesmas ferramentas que usas para outros códigos do Azure Databricks: armazená-lo no Git, executá-lo como um job e implementá-lo com Declarative Automation Bundles.

Esta página explica como transformar um ficheiro de preparação visual de dados do protótipo para a produção.

Armazenar e versionar no Git

O espaço de trabalho armazena ficheiros de preparação de dados visuais de forma nativa. Para versionar um ficheiro de preparação visual de dados, coloque-o numa pasta Git e acompanhe-o como qualquer outro caderno:

  1. Cria uma pasta Git no teu espaço de trabalho.
  2. Move o ficheiro de preparação de dados visuais para essa pasta Git.
  3. Regista, confirma e versiona o ficheiro como qualquer outro notebook no Git. No Git, o ficheiro aparece como <file_name>.designer.ipynb.

Para saber mais sobre pastas Git, consulte pastas Git do Azure Databricks. Para exportar ou importar um ficheiro de preparação de dados visuais, consulte Exportar e importar um ficheiro de preparação de dados visuais.

Agendar como tarefa

Podes automatizar um ficheiro de preparação de dados visual agendando-o como uma tarefa.

  • Agendar diretamente: Clique no botão Agendar no menu superior para criar uma tarefa agendada para o seu ficheiro de preparação de dados visuais.
  • Adicione a um trabalho: Crie um trabalho no Azure Databricks e adicione o seu ficheiro de preparação de dados visuais como uma tarefa. Isto permite-lhe combinar esse ficheiro visual de preparação de dados com outras tarefas num pipeline maior. Na lista pendente Tipo da tarefa, selecione Preparação visual de dados e, em seguida, selecione o ficheiro.

As execuções agendadas mostram cada operador como um nó individual no grafo de tarefas Jobs, para que possas inspecionar os resultados por operador numa execução da mesma forma que fazes no canvas.

Para visualizar e gerir os horários existentes, clique novamente em Agendar para abrir a lista. Clique em Adicionar horário para criar outro, ou abra o ícone do menu Kebab de um calendário. menu kebab para Editar, Executar agora, Pausar, Clonar, Ver em Jobs ou Eliminar .

Mostrar a saída do operador numa execução

Por defeito, uma execução programada gera saída apenas para operadores de terminal (operadores sem ligação a jusante), como um operador de saída. Para ver os resultados de cada operador na execução, expanda Definições Avançadas na janela de diálogo de agendamento e selecione Mostrar saída do operador.

Controlo de agendamento LFD para automatizar um ficheiro de preparação visual de dados como tarefa.

Desligue esta opção para telas grandes para evitar ultrapassar o limite de tamanho de saída.

Selecione o ambiente serverless

Quando trabalha com um ficheiro visual de preparação de dados, pode selecionar o ambiente serverless usado tanto para execuções interativas como para tarefas agendadas. Configura-o a partir do ícone de Ambiente.Painel lateral de ambiente na barra lateral direita, tal como fazes com um caderno. Em ambiente base, selecione uma versão do ambiente. Consulte Configurar o ambiente sem servidor.

Parametrizar entre ambientes

Os parâmetros são valores nomeados definidos para o ficheiro de preparação de dados visuais como um todo, que podes consultar a partir de operadores SQL e Python. Para detalhes sobre a definição e referência de parâmetros, veja Parâmetros.

Os parâmetros permitem executar o mesmo ficheiro de preparação de dados visuais em ambientes diferentes, por exemplo, um catálogo de testes durante o desenvolvimento e um catálogo de produção em produção.

  • Quando agendas um trabalho na interface: Sobrepõe os valores dos parâmetros para cada agendamento. Por exemplo, crie um agendamento que é executado com um parâmetro environment definido como test e outro que é executado com ele definido como production.
  • Quando implementas com um bundle: define os valores dos parâmetros através do job parameters, e usa bundle targets para fornecer valores diferentes por ambiente. Os destinos de desenvolvimento e de produção do bundle permitem-lhe implementar a mesma tarefa para ambientes separados com definições específicas de cada ambiente. Veja modos de implementação dos Pacotes de Automação Declarativa e configuração dos Pacotes de Automação Declarativa.

Em tempo de execução, um ficheiro de preparação visual de dados lê os seus parâmetros da mesma forma, quer seja interativo ou como trabalho, por isso o mesmo ficheiro funciona em todos os teus ambientes sem alterações.

Ler a partir de diferentes tabelas por ambiente

Para ler a partir de uma tabela fonte diferente em cada ambiente, use um operador SQL com parâmetros em vez de um operador Source fixo. Defina catalog, schema, e table os parâmetros, depois referencia-os com a IDENTIFIER() cláusula para construir o nome da tabela dinamicamente:

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Redefina os parâmetros catalog, schema ou table para cada agendamento ou destino do pacote, para que o mesmo ficheiro de preparação visual de dados aponte para dados de teste durante o desenvolvimento e para dados de produção no ambiente de produção. Para mais informações sobre a IDENTIFIER() cláusula, veja IDENTIFIER cláusula.

Implementar com Pacotes de Automação Declarativa

Os Declarative Automation Bundles permitem-te definir e implementar recursos do Azure Databricks, como trabalhos como ficheiros fonte, para que possas aplicar as melhores práticas de engenharia de software como controlo de versões, revisão de código, testes e CI/CD aos teus ficheiros de preparação visual de dados. Veja o que são os Pacotes de Automação Declarativa?

Para implementar um ficheiro de preparação visual de dados ao utilizar um bundle, defina uma tarefa de notebook e referencie o caminho do ficheiro .designer.ipynb em notebook_task.notebook_path. Num pacote, um ficheiro de preparação de dados visuais utiliza a chave notebook_task, embora a IU de Jobs o apresente como um tipo de tarefa Preparação de dados visuais.

O exemplo seguinte define um trabalho que executa um ficheiro visual de preparação de dados localizado ao lado do ficheiro de configuração do bundle:

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Implemente e execute o bundle com a CLI do Azure Databricks:

databricks bundle deploy
databricks bundle run daily_prep_job

Para o conjunto completo de chaves de tarefas do caderno, veja Tarefa do caderno. Para obter uma explicação detalhada sobre como definir uma tarefa num pacote, consulte Desenvolver uma tarefa com Pacotes de Automação Declarativa.

Automatizar com CI/CD

Para validar e implementar automaticamente pacotes de preparação de dados visuais, integre-os num pipeline CI/CD. Para um exemplo usando GitHub Actions, veja GitHub Actions.

Recursos adicionais