Modelli linguistici di grandi dimensioni

Importante

Questa funzionalità è in Anteprima Pubblica.

Questi notebook ottimizzano e post-addestrano grandi modelli linguistici (LLM) su AI Runtime. Trattano metodi efficienti in termini di parametri, come Low-Rank Adaptation (LoRA), e il fine-tuning supervisionato completo in librerie come TRL, Unsloth, Axolotl e LLM Foundry. Per esempi di inferenza batch, vedi Inferenza batch.

Tutoriale Descrizione
Apprendimento per rinforzo di Gemma4-2B Esegui il post-addestramento di Gemma4-2B con Group Relative Policy Optimization (GRPO) e Low-Rank Adaptation (LoRA) su una singola GPU H100 utilizzando Unsloth.
Fine-tuning con supervisione (completo) di Qwen3-4B Eseguire il fine-tuning completo di Qwen3-4B su una singola GPU H100 con TRL, utilizzando la precisione mista BF16 e il gradient checkpointing.
Fine-tuning supervisionato (LoRA) di Llama-3.2-3B LoRA ha affinato Llama-3.2-3B su una singola GPU con la libreria Unsloth.
Supervisioned Fine-tuning (LoRA) di GPT-OSS 20B Ottimizza GPT-OSS 20B con LoRA su 8 GPU H100 con TRL e parallelismo dei dati distribuito.
Supervisione di Fine-tuning (Full) di Llama-3.2-1B Fine-tuning a pesi completi di Llama-3.2-1B su 8 GPU H100 con TRL e DeepSpeed ZeRO Stage 3.
Supervisioned Fine-tuning (LoRA) di Olmo3 7B LoRA affina Olmo3 7B su più GPU con la libreria Axolotl.
Messa a punto con supervisione (Full) e distribuzione di Qwen3.5-0.8B Eseguire il fine-tuning di Qwen3.5-0.8B su una singola GPU H100 con TRL, quindi distribuirlo tramite un endpoint di Model Serving di vLLM.
Fine-tuning supervisionato di Llama-3.2-3B su più GPU LoRA ottimizza Llama-3.2-3B su più GPU con la libreria Unsloth.
Messa a punto supervisionata (LoRA) di GPT-OSS 120B Esegui il fine-tuning LoRA di GPT-OSS 120B su 8 GPU H100 con TRL, usando DDP e FSDP.
Addestrare i transformer su più GPU Eseguire il training dei modelli Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) per partizionare i parametri del modello tra più GPU.

Video dimostrativo

Questo video spiega in dettaglio il Supervised Fine-tuning (LoRA) del quaderno di esempio Llama-3.2-3B (12 minuti).