Contoh AI Runtime CLI

Important

Fitur ini ada di Pratinjau Umum.

Contoh berikut merupakan beban kerja end-to-end lengkap yang Anda kirim melalui CLI air dengan air run -f train.yaml. Masing-masing menampilkan pola multi-GPU dunia nyata pada GPU H100, termasuk berkas YAML workload, perintah bootstrap, dan kode. Mulai dengan mulai cepat jika Anda belum mengirimkan eksekusi sebelumnya.

Example Deskripsi
Penyempurnaan LLM multi-simpul dengan FSDP Diawasi penyempurnaan Llama-3.1-8B di 16 H100 GPU (2 node) menggunakan torchrun dan PyTorch Fully Sharded Data Parallel (FSDP). Mencatat log ke MLflow dan menyimpan checkpoint ke volume Unity Catalog.
Pelatihan terdistribusi dengan Ray Train Penyempurnaan paralel data terdistribusi dengan Ray Train TorchTrainer di seluruh GPU 8 H100 pada satu simpul, dengan satu pekerja per GPU.
Inferensi batch dengan Ray Data dan vLLM Inferensi batch LLM offline dengan Ray Data dan vLLM pada 8 GPU H100 dalam satu node, menjalankan satu replika vLLM per GPU dan menulis hasil ke volume Unity Catalog dalam format Parquet.