Große Sprachmodelle (LLMs)

Von Bedeutung

Dieses Feature befindet sich in der Public Preview.

Diese Notebooks führen die Inferenz großer Sprachmodelle (LLMs) und deren Feinabstimmung in AI Runtime aus. Sie behandeln Batch-Inferenz mit Ray Data und vLLM, parametereffiziente Methoden wie Low-Rank Adaptation (LoRA) und vollständige überwachte Feinabstimmung in Bibliotheken wie TRL, Unsloth, Axolotl und LLM Foundry.

Tutorial Beschreibung
Qwen2.5-32B Batch-Inferenz mit Ray Data und vLLM Führe mehrsprachige Batch-Inferenz mit acht persistenten vLLM-Replikaten von Qwen2.5-32B-Instruct auf 8 H100-GPUs aus und speichere die Ergebnisse im Unity Catalog.
Feinabstimmung des Qwen3-4B-Modells Vollständige Feinabstimmung des Qwen3-4B-Modells auf einer einzelnen H100-GPU mit Transformer Reinforcement Learning (TRL), BF16-Mischpräzision und Gradient Checkpointing für speichereffizientes Training.
Feinabstimmung von Llama-3.2-3B mit Unsloth Feinabstimmung von Llama-3.2-3B mithilfe der Unsloth-Bibliothek.
Feinabstimmung GPT-OSS 20B Optimieren Sie das gpt-oss-20b OpenAI-Modell mit 8 H100-GPUs unter Verwendung von verteilter Datenparallelität und LoRA für eine parametereffiziente Feinabstimmung.
Überwachte Feinabstimmung mit DeepSpeed und TRL Verwenden Sie die Serverless GPU Python-API, um überwachte Feinabstimmungen (SFT) mithilfe der Transformer Reinforcement Learning (TRL)-Bibliothek mit DeepSpeed ZeRO Phase 3 Optimierung auszuführen.
LoRA-Fine-Tuning mit Axolotl Verwenden Sie die Serverless GPU-Python-API, um ein Olmo3 7B-Modell mithilfe der Axolotl-Bibliothek zu optimieren.
Verteilte Feinabstimmung von Qwen2-0,5B Optimieren Sie das Qwen2-0.5B-Modell mithilfe von LoRA- und Liger-Kernels für eine speichereffiziente verteilte Schulung mit Parameterreduzierung.
Verteiltes Fein-Tuning von Llama-3.2-3B mit Unsloth Durchführen einer Feinabstimmung von Llama-3.2-3B mittels verteiltem Training über mehrere GPUs mit der Unsloth-Bibliothek für ein optimiertes, parametereffizientes Training.
Die Feinabstimmung von Llama 3.1 8B mit LLM Foundry Feinjustierung des Llama 3.1 8B-Modells unter Verwendung der Mosaic LLM Foundry mit verteilten Trainingsstrategien und Evaluierung des Modells.
Feinabstimmung GPT-OSS 120B mit DDP und FSDP Optimieren Sie das GPT-OSS 120B-Modell von OpenAI mit überwachter Feinabstimmung auf H100 GPUs mit DDP und FSDP verteilten Trainingsstrategien.
Verteiltes Training mit PyTorch FSDP Trainiere Transformer-Modelle mit PyTorch Fully Sharded Data Parallel (FSDP), um Modellparameter auf mehreren GPUs zu verteilen.

Video-Demo

Dieses Video beschreibt ausführlich das Beispielnotebook Llama-3.2-3B feinabstimmen mit Unsloth (12 Minuten).