중요
이 기능은 공개 미리보기 단계에 있습니다.
다음 예제는 air를 사용하여 air run -f <config>.yaml CLI에서 제출하는 완전한 엔드 투 엔드 워크로드입니다. 각 코드에는 워크로드 YAML, 부트스트랩 스크립트, 그리고 전체 코드가 포함되어 있습니다. 이전에 실행 기록을 제출한 적이 없다면 quickstart부터 시작하세요.
| 예시 | Description |
|---|---|
| FSDP를 사용하여 다중 노드 LLM 미세 조정 | 16개의 H100 GPU(2개 노드) 사용 torchrun 및 PyTorch FSDP(완전 분할 데이터 병렬)에서 Llama-3.1-8B의 감독된 미세 조정 MLflow에 로그하고 Unity 카탈로그 볼륨에 검사점을 기록합니다. |
| 레이, 안녕하세요, 세상 | Ray Core, Ray Train, Ray Data, Ray Tune에 대한 최소한의 작동 예제와 AI 런타임에서 Ray 클러스터를 실행할 때 사용하는 공유 부트스트랩 패턴을 포함합니다. |
| Ray Train을 사용하여 분산 학습 | 단일 노드의 8개 H100 GPU에서 Ray Train의 TorchTrainer 분산 데이터 병렬 미세 조정(GPU당 작업자 1개 포함) |
| Ray Data 및 vLLM을 사용하여 일괄 처리 유추 | 단일 노드에서 8개의 H100 GPU에서 Ray Data 및 vLLM을 사용하여 오프라인 LLM 일괄 처리 유추를 수행하고, GPU당 하나의 vLLM 복제본을 실행하고 결과를 Unity 카탈로그 볼륨에 Parquet로 작성합니다. |
| 레이 튠을 이용한 하이퍼파라미터 탐색 | 4개의 1xA10 노드에서 Ray Tune을 사용해 Qwen2.5-0.5B에 대한 LoRA 하이퍼파라미터를 탐색하고, GPU당 하나의 실험을 실행하며, ASHA 스케줄러로 성능이 낮은 실험을 조기에 중단합니다. |