Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Esse recurso está em Visualização Pública.
O AI Runtime é uma oferta de computação no Databricks destinada a cargas de trabalho de aprendizado profundo e traz suporte de GPU para o Databricks Serverless. Você pode usar o AI Runtime para treinar e ajustar modelos personalizados usando suas estruturas favoritas e obter eficiência, desempenho e qualidade de última geração. Para obter uma visão geral de como a computação sem servidor se encaixa na arquitetura do Databricks, consulte a arquitetura do workspace sem servidor.
Características principais
O AI Runtime combina infraestrutura gerenciada de GPU com um runtime projetado para deep learning:
- Infraestrutura de GPU totalmente gerenciada: acesso flexível e sem servidor a GPUs e sem configuração de cluster, seleção de driver ou políticas de dimensionamento automático a serem gerenciadas.
- Um runtime dedicado ao aprendizado profundo: escolha um ambiente Standard mínimo para obter flexibilidade máxima em relação a dependências ou um ambiente de IA completo pré-carregado com estruturas ML populares.
- Integrados nativamente em notebooks, trabalhos, Catálogo do Unity e MLflow para desenvolvimento contínuo, acesso a dados e acompanhamento de experimentos.
Opções de hardware
Todos os aceleradores de runtime de IA provisionam um único nó. O número de GPUs nesse nó depende do tipo de acelerador:
| Acelerador | GPUs por nó | Memória de GPU | Melhor para | Treinamento distribuído |
|---|---|---|---|---|
| 1xA10 | 1 | 24 GB | Tarefas de ML pequenas a médias e tarefas de aprendizado profundo, como o ajuste fino de modelos clássicos de ML ou de menores modelos de linguagem. | Sem suporte (GPU única) |
| 1xH100 | 1 | 80 GB | Cargas de trabalho que precisam de mais memória de GPU do que a 1xA10 oferece, mas não exigem treinamento distribuído em várias GPUs, como o ajuste fino de modelos de linguagem de médio porte | Sem suporte (GPU única) |
| 8xH100 | 8 | 80 GB por GPU | Cargas de trabalho de IA em larga escala, incluindo treinamento ou ajuste fino de modelos massivos ou execução de tarefas avançadas de aprendizado profundo | Suportado usando o decorador @distributed com gpus=8 |
Dica
Apenas 8xH100 suporta treinamento distribuído com múltiplas GPUs. Para cargas de trabalho com GPU única, escolha 1xA10 ou 1xH100 dependendo da memória GPU que seu modelo precisa.
Casos de uso recomendados
O Databricks recomenda o AI Runtime para qualquer caso de uso de treinamento de modelo personalizado que envolva aprendizado profundo, cargas de trabalho clássicas em larga escala ou GPUs.
Por exemplo:
- Refinamento de LLM (LoRA, QLoRA, refinamento completo)
- Pesquisa visual computacional (detecção de objetos, classificação de imagem)
- Sistemas de recomendação baseados em aprendizado profundo
- Aprendizado de reforço
- Previsão de série temporal baseada em aprendizado profundo
Requisitos
Antes de começar, confirme que seu espaço de trabalho atende a estes requisitos:
- Um workspace em uma das seguintes regiões com suporte do Azure:
centraluseastuseastus2northcentraluswestcentraluswestuswestus3
- A pré-visualização do tempo de execução da IA deve ser ativada pelas configurações de administrador do workspace. Veja Gerenciar prévias de Databricks.
Limitations
Tenha em mente as seguintes limitações ao planejar uma carga de trabalho em tempo de execução de IA:
- O AI Runtime só dá suporte a aceleradores A10 e H100.
- O AI Runtime não dá suporte ao perfil de segurança de conformidade para os padrões FedRAMP High ou DoD IL5.
- Não há suporte para a adição de dependências usando o painel Ambientes para trabalhos agendados do AI Runtime. Em vez disso, instale dependências usando
%pip installprogramaticamente em seu notebook. - Para trabalhos agendados no AI Runtime, não há suporte para o comportamento de recuperação automática para versões de pacote incompatíveis associadas ao seu notebook.
- As tentativas de conexão com o ambiente de execução de IA são encerradas após 15 minutos para notebooks interativos e após 24 horas para jobs de notebook ou de CLI. Sessões e trabalhos de notebook conectados podem durar até dois dias, e jobs de CLI podem durar até 14 dias. Para tarefas de treinamento de modelos de longa duração, implemente pontos de verificação e reinicie a tarefa quando o tempo máximo de execução for atingido.
- O AI Runtime fornece acesso sob demanda aos recursos de GPU. Embora isso leve a um acesso fácil e flexível a GPUs, pode haver períodos em que a capacidade está restrita ou indisponível em sua região.
- O AI Runtime aproveita GPUs entre regiões em determinados casos durante momentos de alta demanda. Pode haver custos de saída associados a esse uso, e a conectividade de rede entre regiões pode ser limitada em determinados momentos.
Conectar-se ao AI Runtime
Você pode se conectar ao AI Runtime interativamente a partir de notebooks, um terminal IDE usando um túnel SSH, trabalhos agendados, a API de Trabalhos e Pacotes de Automação Declarativa. Para instruções passo a passo, veja Conectar ao Runtime de IA a partir de um notebook.
Configurar o ambiente
O AI Runtime oferece dois ambientes de Python gerenciados: um ambiente Standard mínimo e um ambiente de IA do Databricks completo pré-carregado com estruturas ML populares, como PyTorch e Transformers. Para obter detalhes sobre como escolher um ambiente, comportamento de cache, importação de módulos personalizados e limitações conhecidas, consulte Configurar seu ambiente.
Dica
Escolha o ambiente Standard para ter controle total sobre sua pilha de dependências ou o ambiente Databricks AI para evitar instalar frameworks comuns como PyTorch e Transformers.
Carregar dados no AI Runtime
Entender como o acesso a dados funciona no AI Runtime é essencial para uma experiência tranquila. Para obter detalhes, consulte Carregar dados no AI Runtime.
Treinamento distribuído
O AI Runtime dá suporte ao treinamento distribuído em várias GPUs no único nó ao qual seu notebook está conectado. Usando o @distributed decorador da serverless_gpu API Python, você pode iniciar cargas de trabalho de várias GPUs com PyTorch DDP, FSDP ou DeepSpeed com configuração mínima. Para obter detalhes, consulte Treinamento distribuído em notebooks.
Dica
Valide sua carga de trabalho em uma única GPU antes de escalar para 8xH100 com o decorador @distributed.
Ray no ambiente de execução de IA
O AI Runtime suporta o Ray para cargas de trabalho distribuídas de GPU, incluindo Ray Core, Ray Data, Ray Train e Ray Tune. Você pode executar jobs do Ray de nó único e multinó em computação serverless com GPU, sem precisar configurar um cluster. Para mais detalhes e exemplos, consulte Ray on AI Runtime.
Acompanhamento e observabilidade de experimentos
Para a integração com o MLflow, visualização de logs e gerenciamento de checkpoints de modelo, consulte Acompanhamento de experimentos e observabilidade.
Colocar cargas de trabalho de treinamento em produção
Implante uma carga de trabalho do AI Runtime com Pacotes de Automação Declarativa para executar seu próprio código de treinamento, criar trabalhos multitarefa que combinem tarefas de GPU e CPU, agendar pipelines e promover da fase de desenvolvimento para a produção. Veja Colocar cargas de trabalho de treinamento em produção.
Código do Genie para aprendizado profundo
O Genie Code pode ajudar a desenvolver e solucionar problemas de cargas de trabalho de aprendizado profundo em tempo de execução de IA. Ele pode gerar código de treinamento distribuído, resolver problemas de ambiente e dependências, e investigar falhas de GPU e cargas de trabalho distribuídas. Veja Como usar o Genie Code com o runtime de IA.
Guides
Para migrar de cargas de trabalho clássicas, notebooks de exemplo e solução de problemas, consulte guias de usuário para o AI Runtime.