Utilize o Genie Code com ambiente de execução de IA

Importante

Este recurso está no Public Preview.

O Genie Code ajuda-o a desenvolver e resolver problemas com cargas de trabalho de aprendizagem profunda em notebooks ligados ao AI Runtime. Pode gerar código de treino distribuído, resolver problemas de ambiente e dependências, e investigar falhas de carga de trabalho da GPU.

O Genie Code cria e executa uma carga de trabalho distribuída de treino CNN através de oito GPUs H100 num portátil de IA Runtime.

Requirements

Para usar o Genie Code com AI Runtime:

Introdução

  1. Abra um notebook do Azure Databricks.

  2. Liga o portátil ao AI Runtime. Consulte Ligar-se ao runtime de IA.

  3. Abrir o painel Genie Code.

  4. Descreve a carga de trabalho que queres desenvolver ou o problema que queres resolver.

  5. Revise o plano proposto, as alterações ao código e as ações antes de os aprovar.

    Importante

    O Código Génio pode cometer erros. Revise o código gerado, as alterações ao ambiente e outras ações propostas antes de as executar. Alguns diagnósticos requerem registos adicionais ou contexto de carga de trabalho.

Em que pode o Genie Code ajudar?

Desenvolver cargas de trabalho de treino distribuídas

O Genie Code pode gerar ou atualizar código de treino para IA Runtime. Pode ajudá-lo a selecionar uma estratégia distribuída do PyTorch adequada, usar a API @distributed do pacote serverless_gpu e aplicar padrões do AI Runtime para carregamento de dados, checkpointing e monitorização com o MLflow. Para obter detalhes e exemplos da API, consulte treino distribuído em notebooks.

Resolver questões de ambiente e dependência

O Genie Code pode inspecionar o ambiente atual, distinguir falhas de compatibilidade de pacotes de alterações de código ou API e recomendar correções direcionadas. Também pode ajudá-lo a escolher entre os ambientes de IA Databricks e Standard com base nas dependências da sua carga de trabalho. Para informações sobre os ambientes disponíveis, consulte Configurar o seu ambiente.

Depurar cargas de trabalho da GPU e cargas de trabalho distribuídas

O Genie Code pode usar a saída gerada pelo notebook e os registos disponíveis para investigar falhas de treino distribuído, erros de comunicação, bloqueios durante o treino e problemas de memória da GPU. Pode ajudar a identificar a falha original e distingui-la de erros posteriores noutros postos. Para informações sobre a visualização de registos de treino distribuídos, veja Rastreio e observabilidade de experiências.

Exemplos de sugestões

Desenvolver cargas de trabalho de treino distribuídas

  • Atualize este notebook para executar treino distribuído nas oito GPUs H100 no AI Runtime.
  • Reveja este notebook de treino distribuído e corrija a sua utilização de serverless_gpu e do MLflow.
  • "Adapta esta carga de treino para o tempo de execução da IA e explica as mudanças importantes."

Resolver questões de ambiente e dependência

  • "Este caderno deixou de funcionar depois de instalar um novo pacote. Inspecionar o ambiente e determinar se o problema é uma questão de dependência ou uma alteração da API de código."
  • "Esta carga de trabalho deve usar a IA Databricks ou o ambiente Standard? Revê as suas dependências e recomenda um ambiente antes de mudar qualquer coisa.
  • "Diagnosticar este erro de compatibilidade com o pacote e recomendar a menor alteração apropriada."

Depurar cargas de trabalho de GPU e distribuídas

  • Analise esta execução falhada de treino distribuído utilizando a saída disponível de cada rank e identifique a causa principal.
  • "Porque é que esta carga de trabalho distribuída está suspensa? Utilize o resultado do notebook para recomendar o próximo passo de depuração.
  • "Investigar esta falha de memória da GPU e recomendar um próximo passo baseado em evidências."

Recursos adicionais