Use o código Genie com tempo de execução de IA

Importante

Esse recurso está em Visualização Pública.

O Genie Code ajuda você a desenvolver e solucionar problemas de cargas de trabalho de deep learning em notebooks conectados ao AI Runtime. Ele pode gerar código de treinamento distribuído, resolver problemas de ambiente e dependências, e investigar falhas de carga de trabalho da GPU.

O Genie Code cria e executa uma carga de trabalho distribuída de treinamento de CNN em oito GPUs H100 em um notebook do AI Runtime.

Requirements

Para usar o Genie Code com o runtime de IA:

Introdução

  1. Abra um notebook do Azure Databricks.

  2. Conecte o notebook ao AI Runtime. Veja Conectar-se ao AI Runtime.

  3. Abra o painel Genie Code.

  4. Descreva a carga de trabalho que você quer desenvolver ou o problema que deseja resolver.

  5. Revise o plano proposto, as mudanças no código e as ações antes de aprová-los.

    Importante

    O Código Gênio pode cometer erros. Revise o código gerado, as mudanças no ambiente e outras ações propostas antes de executá-las. Alguns diagnósticos exigem logs adicionais ou contexto de carga de trabalho.

Com o que o Genie Code pode ajudar?

Desenvolver cargas de trabalho de treinamento distribuídas

O Genie Code pode gerar ou atualizar código de treinamento para o tempo de execução da IA. Ela pode ajudar você a selecionar uma estratégia de distribuição apropriada do PyTorch, usar a API @distributed do pacote serverless_gpu e aplicar padrões do AI Runtime para carregamento de dados, checkpoints e rastreamento no MLflow. Para detalhes e exemplos de API, veja Treinamento distribuído em cadernos.

Resolver questões de ambiente e dependência

O Genie Code pode inspecionar o ambiente atual, distinguir falhas de compatibilidade de pacotes de mudanças no código ou na API, e recomendar correções direcionadas. Também pode ajudar você a escolher entre os ambientes de IA e Standard do Databricks, com base nas dependências da sua carga de trabalho. Para informações sobre os ambientes disponíveis, veja Configure seu ambiente.

Depurar GPU e cargas de trabalho distribuídas

O Genie Code pode usar a saída de notebooks e os logs disponíveis para investigar falhas de treinamento distribuído, erros de comunicação, travamentos no treinamento e problemas de memória da GPU. Pode ajudar a identificar a falha original e distingui-la de erros subsequentes em outros ranks. Para informações sobre a visualização de logs de treinamento distribuídos, veja Rastreamento e observabilidade de experimentos.

Prompts de exemplo

Desenvolver cargas de trabalho de treinamento distribuídas

  • "Atualize este notebook para rodar treinamento distribuído em todas as oito GPUs H100 em tempo de execução de IA."
  • Revise este notebook de treinamento distribuído e corrija o uso de serverless_gpu e MLflow.
  • "Adapte essa carga de treinamento para o Runtime de IA e explique as mudanças importantes."

Resolver questões de ambiente e dependência

  • "Este caderno parou de funcionar depois que instalei um novo pacote. Inspecione o ambiente e determine se o problema é um problema de dependência ou uma alteração na API de código."
  • "Essa carga de trabalho deve usar a IA do Databricks ou o ambiente Standard? Revise suas dependências e recomende um ambiente antes de mudar qualquer coisa."
  • "Diagnostice esse erro de compatibilidade do pacote e recomende a menor alteração apropriada."

Depurar GPU e cargas de trabalho distribuídas

  • Analise esta execução com falha de treinamento distribuído com base na saída disponível de cada rank e identifique a causa raiz.
  • "Por que essa carga de trabalho distribuída está pendurada? Use a saída do notebook para recomendar a próxima etapa de depuração.
  • "Investigue essa falha de memória da GPU e recomende um próximo passo baseado em evidências."

Recursos adicionais