Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Esse recurso está em Visualização Pública.
Esses notebooks fazem o ajuste fino e o pós-treinamento de grandes modelos de linguagem (LLMs) no AI Runtime. Eles abrangem métodos com uso eficiente de parâmetros, como Adaptação de Baixa Classificação (LoRA) e ajuste fino supervisionado completo em bibliotecas como TRL, Unsloth, Axolotl e LLM Foundry. Para exemplos de inferência em lote, veja Inferência em lote.
| Tutorial | Descrição |
|---|---|
| Aprendizado por reforço de Gemma4-2B | Pós-treinamento do Gemma4-2B com Otimização de Política Relativa a Grupos (GRPO) e Adaptação de Baixa Classificação (LoRA) em uma única GPU H100 usando Unsloth. |
| Ajuste fino supervisionado (completo) de Qwen3-4B | Ajuste fino completo de pesos do Qwen3-4B em uma única GPU H100 com TRL, usando precisão mista BF16 e checkpoint de gradiente. |
| Ajuste fino supervisionado (LoRA) do Llama-3.2-3B | LoRA ajuste finamente o Llama-3.2-3B em uma única GPU com a biblioteca Unsloth. |
| Ajuste Fino Supervisionado (LoRA) de GPT-OSS 20B | LoRA ajuste fino GPT-OSS 20B em 8 GPUs H100 com TRL e paralelismo distribuído de dados. |
| Ajuste Fino Supervisionado (Completo) do Llama-3.2-1B | Ajuste fino completo do modelo Llama-3.2-1B usando 8 GPUs H100 com TRL e DeepSpeed ZeRO Stage 3. |
| Ajuste fino supervisionado (LoRA) do Olmo3 7B | LoRA ajusta finamente o Olmo3 7B em várias GPUs com a biblioteca Axolotl. |
| Ajuste fino supervisionado (completo) e implantação do Qwen3.5-0.8B | Faça o ajuste fino do Qwen3.5-0.8B em uma única GPU H100 com TRL e depois disponibilize-o por trás de um endpoint de Model Serving do vLLM. |
| Ajuste fino supervisionado do Llama-3.2-3B em múltiplas GPUs | LoRA ajuste finamente o Llama-3.2-3B em múltiplas GPUs com a biblioteca Unsloth. |
| Ajuste fino supervisionado (LoRA) de GPT-OSS 120B | LoRA ajuste fino GPT-OSS 120B em 8 GPUs H100 com TRL, usando DDP e FSDP. |
| Treinando transformers em múltiplas GPUs | Treine modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para dividir os parâmetros do modelo em várias GPUs. |
Demonstração de vídeo
Este vídeo explica em detalhes o Ajuste Fino Supervisionado (LoRA) do caderno de exemplo Llama-3.2-3B (12 minutos).