Genie 코드를 AI 런타임과 함께 사용하세요

Genie Code는 AI 런타임에 연결된 노트북에서 딥러닝 작업 부하를 개발하고 문제 해결하는 데 도움을 줍니다. 분산 학습 코드를 생성하고, 환경 및 의존성 문제를 해결하며, GPU 워크로드 장애를 조사할 수 있습니다.

Genie Code는 AI 런타임 노트북 내에서 8개의 H100 GPU에 분산 CNN 학습 작업을 생성하고 실행합니다.

Requirements

AI 런타임에 Genie Code를 사용하려면:

Get started

  1. Azure Databricks 노트북을 열어라.

  2. 노트북을 AI 런타임에 연결하세요. Connect to AI Runtime을 참조하세요.

  3. 지니 코드 창을 열어보세요.

  4. 개발하고 싶은 업무량이나 해결하고 싶은 문제를 설명하세요.

  5. 승인 전에 제안된 계획, 코드 변경 사항 및 조치를 검토하세요.

    Important

    지니 코드도 실수를 할 수 있습니다. 생성된 코드, 환경 변경 사항 및 기타 제안된 행동을 실행하기 전에 검토하세요. 일부 진단은 추가 기록이나 업무량 맥락이 필요합니다.

지니 코드는 무엇을 도울 수 있습니까?

분산 훈련 워크로드 개발

Genie Code는 AI 런타임용 학습 코드를 생성하거나 업데이트할 수 있습니다. 적절한 PyTorch 분산 전략을 선택하고, 패키지의 serverless_gpu API를 @distributed 활용하며, 데이터 로딩, 체크포인트, MLflow 추적에 AI 런타임 패턴을 적용하는 데 도움을 줄 수 있습니다. API 세부 사항과 예시는 노트북에서의 분산 학습을 참조하세요.

환경 및 의존성 문제 해결

Genie Code는 현재 환경을 점검하고, 패키지 호환성 실패와 코드 또는 API 변경을 구분하며, 목표 해결책을 권고할 수 있습니다. 또한 워크로드의 의존성에 따라 Databricks AI와 Standard 환경 중 선택할 수 있도록 도와줍니다. 이용 가능한 환경에 대한 정보는 '환경 설정 하기'를 참조하세요.

GPU 및 분산 워크로드 디버깅

Genie Code는 노트북 출력과 사용 가능한 로그를 사용하여 분산 학습 실패, 통신 오류, 학습 중단, GPU 메모리 문제를 조사할 수 있습니다. 원래의 실패를 식별하고 다른 계급의 하위 오류와 구분하는 데 도움을 줄 수 있습니다. 분산 훈련 로그 뷰에 관한 정보는 실험 추적 및 관측 가능성을 참조하세요.

예시 프롬프트

분산 훈련 워크로드 개발

  • "이 노트북을 AI 런타임에서 8개의 H100 GPU 전원에서 분산 학습을 실행하도록 업데이트하세요."
  • "이 분산 교육 노트북을 검토하고 MLflow의 serverless_gpu 사용을 수정하세요."
  • "이 훈련 작업 부하를 AI 런타임에 맞게 조정하고 중요한 변경 사항을 설명하세요."

환경 및 의존성 문제 해결

  • "이 노트북은 새 패키지를 설치한 후에 작동을 멈췄어. 환경을 점검하여 문제가 의존성 문제인지 코드 API 변경인지 판단하세요."
  • "이 작업부는 Databricks AI 환경을 사용해야 할까요, 아니면 Standard 환경을 사용해야 할까요? 어떤 변경도 하기 전에 의존성을 검토하고 환경을 권장하세요."
  • "이 패키지 호환성 오류를 진단하고 가장 작은 적절한 변경 사항을 권고합니다."

GPU 및 분산 워크로드 디버깅

  • "모든 랭크에서 얻은 출력 데이터를 사용해 이 실패한 분산 훈련 실행을 분석하고 근본 원인을 찾아라."
  • "왜 이 분산된 업무량이 계속 지연되는 거지? 노트북 출력을 사용해 다음 디버깅 단계를 추천하세요."
  • "이 GPU 메모리 고장을 조사하고 근거 기반의 다음 조치를 권고하라."

추가 리소스