AI 런타임 CLI 예제

다음 예제는 air를 사용하여 air run -f <config>.yaml CLI에서 제출하는 완전한 엔드 투 엔드 워크로드입니다. 각 코드에는 워크로드 YAML, 부트스트랩 스크립트, 그리고 전체 코드가 포함되어 있습니다. 이전에 실행 기록을 제출한 적이 없다면 quickstart부터 시작하세요.

예시 Description
FSDP를 사용하여 다중 노드 LLM 미세 조정 16개의 H100 GPU(2개 노드) 사용 torchrun 및 PyTorch FSDP(완전 분할 데이터 병렬)에서 Llama-3.1-8B의 감독된 미세 조정 MLflow에 로그하고 Unity 카탈로그 볼륨에 검사점을 기록합니다.
레이, 안녕하세요, 세상 Ray Core, Ray Train, Ray Data, Ray Tune에 대한 최소한의 작동 예제와 AI 런타임에서 Ray 클러스터를 실행할 때 사용하는 공유 부트스트랩 패턴을 포함합니다.
Ray Train을 사용하여 분산 학습 단일 노드의 8개 H100 GPU에서 Ray Train의 TorchTrainer 분산 데이터 병렬 미세 조정(GPU당 작업자 1개 포함)
Ray Data 및 vLLM을 사용하여 일괄 처리 유추 단일 노드에서 8개의 H100 GPU에서 Ray Data 및 vLLM을 사용하여 오프라인 LLM 일괄 처리 유추를 수행하고, GPU당 하나의 vLLM 복제본을 실행하고 결과를 Unity 카탈로그 볼륨에 Parquet로 작성합니다.
레이 튠을 이용한 하이퍼파라미터 탐색 4개의 1xA10 노드에서 Ray Tune을 사용해 Qwen2.5-0.5B에 대한 LoRA 하이퍼파라미터를 탐색하고, GPU당 하나의 실험을 실행하며, ASHA 스케줄러로 성능이 낮은 실험을 조기에 중단합니다.