Крупные языковые модели (LLM)

Это важно

Эта функция доступна в общедоступной предварительной версии.

Эти ноутбуки дорабатывают и обучают большие языковые модели (LLM) на AI Runtime. Они охватывают параметрически эффективные методы, такие как Low-Rank Adaptation (LoRA), и полную контролируемую тонкую настройку между библиотеками, включая TRL, Unsloth, Axolotl и LLM Foundry. Для примеров пакетного вывода см. Пакетный вывод.

Руководство Описание
Подкрепляющее обучение Gemma4-2B Дообучите Gemma4-2B с помощью Group Relative Policy Optimization (GRPO) и низкоранговой адаптации (LoRA) на одном GPU H100 с помощью Unsloth.
Контролируемая тонкая настройка (полная) Qwen3-4B Полная настройка Qwen3-4B на одной видеокарте H100 с TRL, используя смешанную точность и градиентную контрольную точку BF16.
Контролируемая тонкая настройка (LoRA) Llama-3.2-3B LoRA дорабатывает Llama-3.2-3B на одной видеокарте с библиотекой Unsloth.
Контролируемая тонкая настройка (LoRA) GPT-OSS 20B Дообучение GPT-OSS 20B методом LoRA на 8 GPU H100 с использованием TRL и распределённого параллелизма данных.
Контролируемая тонкая настройка (полная) Llama-3.2-1B Полновесная тонкая настройка Llama-3.2-1B на 8 графических процессорах H100 с TRL и DeepSpeed ZeRO Stage 3.
Контролируемая тонкая настройка (LoRA) Olmo3 7B LoRA дорабатывает Olmo3 7B на нескольких GPU с помощью библиотеки Axolotl.
Контролируемая тонкая настройка (полная) и подача Qwen3.5-0.8B Дообучите Qwen3.5-0.8B на одном GPU H100 с помощью TRL, а затем разверните его через конечную точку обслуживания моделей vLLM.
Контролируемая тонкая настройка Llama-3.2-3B на мульти-графических процессорах LoRA дорабатывает Llama-3.2-3B на нескольких GPU с помощью библиотеки Unsloth.
Контролируемая тонкая настройка (LoRA) GPT-OSS 120B LoRA тонко настроил GPT-OSS 120B на 8 видеокартах H100 с TRL, используя DDP и FSDP.
Обучение трансформаторов на мульти-графических процессорах Обучение трансформерных моделей с помощью PyTorch FSDP для сегментирования параметров модели на нескольких GPU.

Демонстрация видео

В этом видео подробно разбирается пример блокнота контролируемой донастройки (LoRA) Llama-3.2-3B (12 минут).