Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Esse recurso está em Visualização Pública.
O Genie Code ajuda você a desenvolver e solucionar problemas de cargas de trabalho de deep learning em notebooks conectados ao AI Runtime. Ele pode gerar código de treinamento distribuído, resolver problemas de ambiente e dependências, e investigar falhas de carga de trabalho da GPU.
Requirements
Para usar o Genie Code com o runtime de IA:
- Atenda aos requisitos dos recursos agênticos do Genie Code.
- Tenha acesso ao AI Runtime em uma região que suporte ambos os produtos. Veja requisitos de tempo de execução da IA e disponibilidade geográfica do Código Genie.
- Conecte um notebook ao AI Runtime usando computação de GPU serverless. Veja Conectar ao AI Runtime.
Introdução
Abra um notebook do Azure Databricks.
Conecte o notebook ao AI Runtime. Veja Conectar-se ao AI Runtime.
Abra o painel Genie Code.
Descreva a carga de trabalho que você quer desenvolver ou o problema que deseja resolver.
Revise o plano proposto, as mudanças no código e as ações antes de aprová-los.
Importante
O Código Gênio pode cometer erros. Revise o código gerado, as mudanças no ambiente e outras ações propostas antes de executá-las. Alguns diagnósticos exigem logs adicionais ou contexto de carga de trabalho.
Com o que o Genie Code pode ajudar?
Desenvolver cargas de trabalho de treinamento distribuídas
O Genie Code pode gerar ou atualizar código de treinamento para o tempo de execução da IA. Ela pode ajudar você a selecionar uma estratégia de distribuição apropriada do PyTorch, usar a API @distributed do pacote serverless_gpu e aplicar padrões do AI Runtime para carregamento de dados, checkpoints e rastreamento no MLflow. Para detalhes e exemplos de API, veja Treinamento distribuído em cadernos.
Resolver questões de ambiente e dependência
O Genie Code pode inspecionar o ambiente atual, distinguir falhas de compatibilidade de pacotes de mudanças no código ou na API, e recomendar correções direcionadas. Também pode ajudar você a escolher entre os ambientes de IA e Standard do Databricks, com base nas dependências da sua carga de trabalho. Para informações sobre os ambientes disponíveis, veja Configure seu ambiente.
Depurar GPU e cargas de trabalho distribuídas
O Genie Code pode usar a saída de notebooks e os logs disponíveis para investigar falhas de treinamento distribuído, erros de comunicação, travamentos no treinamento e problemas de memória da GPU. Pode ajudar a identificar a falha original e distingui-la de erros subsequentes em outros ranks. Para informações sobre a visualização de logs de treinamento distribuídos, veja Rastreamento e observabilidade de experimentos.
Prompts de exemplo
Desenvolver cargas de trabalho de treinamento distribuídas
- "Atualize este notebook para rodar treinamento distribuído em todas as oito GPUs H100 em tempo de execução de IA."
- Revise este notebook de treinamento distribuído e corrija o uso de
serverless_gpue MLflow. - "Adapte essa carga de treinamento para o Runtime de IA e explique as mudanças importantes."
Resolver questões de ambiente e dependência
- "Este caderno parou de funcionar depois que instalei um novo pacote. Inspecione o ambiente e determine se o problema é um problema de dependência ou uma alteração na API de código."
- "Essa carga de trabalho deve usar a IA do Databricks ou o ambiente Standard? Revise suas dependências e recomende um ambiente antes de mudar qualquer coisa."
- "Diagnostice esse erro de compatibilidade do pacote e recomende a menor alteração apropriada."
Depurar GPU e cargas de trabalho distribuídas
- Analise esta execução com falha de treinamento distribuído com base na saída disponível de cada rank e identifique a causa raiz.
- "Por que essa carga de trabalho distribuída está pendurada? Use a saída do notebook para recomendar a próxima etapa de depuração.
- "Investigue essa falha de memória da GPU e recomende um próximo passo baseado em evidências."