기존 딥 러닝 워크로드를 클래식 Databricks 클러스터(Databricks 런타임 ML 사용)에서 서버리스(AI 런타임 사용)로 이동하는 경우 다음 단계를 수행합니다.
- 클러스터 종속 코드를 대체합니다. Spark 기반 분산 학습에 대한 참조를 제거하고(예:
TorchDistributor)@distributed의 데코레이터serverless_gpu으로 대체하십시오. - 데이터 로드를 업데이트합니다. 직접 DBFS 경로를 Unity 카탈로그 볼륨 경로(
/Volumes/...)로 바꿉니다. 로컬 Spark DataFrame 작업을 Spark Connect로 대체합니다. 볼륨의 파일 기반 데이터를 스트리밍하려면UCVolumeDataset에서serverless_gpu.data을 사용하세요. AI 런타임에서 데이터 로드를 참조하세요. - 환경을 설정합니다. 일부 Databricks 런타임 머신러닝 사전 설치 라이브러리는 AI 런타임에는 제공되지 않습니다. 서버리스 GPU 환경을 설정하고 작업량에 필요한
%pip install패키지를 설치하세요. 환경 설정을 참조하세요. - 검사점 경로를 업데이트합니다. DBFS 또는 로컬 스토리지에서 Unity 카탈로그 볼륨(
/Volumes/<catalog>/<schema>/<volume>/...)으로 검사점을 이동합니다. 분산 체크포인팅에는 로컬 NVMe를 통해 I/O를 스테이징하는UCVolumeWriter의UCVolumeReader및serverless_gpu.data을 사용하세요. 모델 체크포인팅을 참조하세요. - MLflow 설정을 검토해 보세요. AI Runtime에서
.distributed()API는 MLflow 실행을 자동으로 생성합니다. 실험을 맞춤화하려면 절대 경로를 설정하세요. 중단된 실행을 재개하려면 실행 이름을 설정하세요. MLflow 통합을 참조하세요. - 먼저 대화형으로 테스트합니다. 작업으로 예약하기 전에 대화형 Notebook에서 워크로드의 유효성을 검사합니다.