클래식 GPU 작업 부하를 서버리스로 마이그레이션하세요

기존 딥 러닝 워크로드를 클래식 Databricks 클러스터(Databricks 런타임 ML 사용)에서 서버리스(AI 런타임 사용)로 이동하는 경우 다음 단계를 수행합니다.

  1. 클러스터 종속 코드를 대체합니다. Spark 기반 분산 학습에 대한 참조를 제거하고(예: TorchDistributor) @distributed의 데코레이터 serverless_gpu으로 대체하십시오.
  2. 데이터 로드를 업데이트합니다. 직접 DBFS 경로를 Unity 카탈로그 볼륨 경로(/Volumes/...)로 바꿉니다. 로컬 Spark DataFrame 작업을 Spark Connect로 대체합니다. 볼륨의 파일 기반 데이터를 스트리밍하려면 UCVolumeDataset에서 serverless_gpu.data을 사용하세요. AI 런타임에서 데이터 로드를 참조하세요.
  3. 환경을 설정합니다. 일부 Databricks 런타임 머신러닝 사전 설치 라이브러리는 AI 런타임에는 제공되지 않습니다. 서버리스 GPU 환경을 설정하고 작업량에 필요한 %pip install패키지를 설치하세요. 환경 설정을 참조하세요.
  4. 검사점 경로를 업데이트합니다. DBFS 또는 로컬 스토리지에서 Unity 카탈로그 볼륨(/Volumes/<catalog>/<schema>/<volume>/...)으로 검사점을 이동합니다. 분산 체크포인팅에는 로컬 NVMe를 통해 I/O를 스테이징하는 UCVolumeWriter의 UCVolumeReader 및 serverless_gpu.data을 사용하세요. 모델 체크포인팅을 참조하세요.
  5. MLflow 설정을 검토해 보세요. AI Runtime에서 .distributed() API는 MLflow 실행을 자동으로 생성합니다. 실험을 맞춤화하려면 절대 경로를 설정하세요. 중단된 실행을 재개하려면 실행 이름을 설정하세요. MLflow 통합을 참조하세요.
  6. 먼저 대화형으로 테스트합니다. 작업으로 예약하기 전에 대화형 Notebook에서 워크로드의 유효성을 검사합니다.