Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Genie Code ajuda-o a desenvolver e resolver problemas com cargas de trabalho de aprendizagem profunda em notebooks ligados ao AI Runtime. Pode gerar código de treino distribuído, resolver problemas de ambiente e dependências, e investigar falhas de carga de trabalho da GPU.
Requirements
Para usar o Genie Code com AI Runtime:
- Cumpra os requisitos para as capacidades agênticas do Genie Code.
- Ter acesso ao AI Runtime numa região que suporta ambos os produtos. Consulte os requisitos de execução da IA e a disponibilidade geográfica do Código Genie.
- Ligue um portátil ao AI Runtime com computação GPU sem servidor. Consulte Ligar-se ao runtime de IA.
Introdução
Abra um notebook do Azure Databricks.
Liga o portátil ao AI Runtime. Consulte Ligar-se ao runtime de IA.
Abrir o painel Genie Code.
Descreve a carga de trabalho que queres desenvolver ou o problema que queres resolver.
Revise o plano proposto, as alterações ao código e as ações antes de os aprovar.
Importante
O Código Génio pode cometer erros. Revise o código gerado, as alterações ao ambiente e outras ações propostas antes de as executar. Alguns diagnósticos requerem registos adicionais ou contexto de carga de trabalho.
Em que pode o Genie Code ajudar?
Desenvolver cargas de trabalho de treino distribuídas
O Genie Code pode gerar ou atualizar código de treino para IA Runtime. Pode ajudá-lo a selecionar uma estratégia distribuída do PyTorch adequada, usar a API @distributed do pacote serverless_gpu e aplicar padrões do AI Runtime para carregamento de dados, checkpointing e monitorização com o MLflow. Para obter detalhes e exemplos da API, consulte treino distribuído em notebooks.
Resolver questões de ambiente e dependência
O Genie Code pode inspecionar o ambiente atual, distinguir falhas de compatibilidade de pacotes de alterações de código ou API e recomendar correções direcionadas. Também pode ajudá-lo a escolher entre os ambientes de IA Databricks e Standard com base nas dependências da sua carga de trabalho. Para informações sobre os ambientes disponíveis, consulte Configurar o seu ambiente.
Depurar cargas de trabalho da GPU e cargas de trabalho distribuídas
O Genie Code pode usar a saída gerada pelo notebook e os registos disponíveis para investigar falhas de treino distribuído, erros de comunicação, bloqueios durante o treino e problemas de memória da GPU. Pode ajudar a identificar a falha original e distingui-la de erros posteriores noutros postos. Para informações sobre a visualização de registos de treino distribuídos, veja Rastreio e observabilidade de experiências.
Exemplos de sugestões
Desenvolver cargas de trabalho de treino distribuídas
- Atualize este notebook para executar treino distribuído nas oito GPUs H100 no AI Runtime.
- Reveja este notebook de treino distribuído e corrija a sua utilização de
serverless_gpue do MLflow. - "Adapta esta carga de treino para o tempo de execução da IA e explica as mudanças importantes."
Resolver questões de ambiente e dependência
- "Este caderno deixou de funcionar depois de instalar um novo pacote. Inspecionar o ambiente e determinar se o problema é uma questão de dependência ou uma alteração da API de código."
- "Esta carga de trabalho deve usar a IA Databricks ou o ambiente Standard? Revê as suas dependências e recomenda um ambiente antes de mudar qualquer coisa.
- "Diagnosticar este erro de compatibilidade com o pacote e recomendar a menor alteração apropriada."
Depurar cargas de trabalho de GPU e distribuídas
- Analise esta execução falhada de treino distribuído utilizando a saída disponível de cada rank e identifique a causa principal.
- "Porque é que esta carga de trabalho distribuída está suspensa? Utilize o resultado do notebook para recomendar o próximo passo de depuração.
- "Investigar esta falha de memória da GPU e recomendar um próximo passo baseado em evidências."