환경 설정

중요합니다

이 기능은 공개 미리보기 단계에 있습니다.

AI 런타임은 서버리스 GPU 컴퓨트를 위한 두 가지 관리형 Python 환경을 제공합니다. 표준 환경에는 cuda. 환경 버전 5 torchtorchvision 를 기준으로 더 이상 사전 설치되지 않습니다. Databricks AI 환경은 PyTorch, Transformers 및 기타 ML 및 딥러닝 프레임워크가 미리 탑재되어 있습니다. 종속성 스택에 대한 모든 권한을 위한 표준 환경 또는 즉시 사용할 수 있는 학습 설정을 위한 AI 환경을 선택합니다. 어느 환경에서든 시작해서 직접 더 많은 패키지를 설치할 수 있습니다.

Tip

  • 의존성을 완전히 제어하려면 표준 환경을 선택하거나, 즉시 사용할 수 있는 ML 스택을 위해서는 Databricks AI 환경을 선택하세요.
  • 표준에는 cuda가 포함됩니다. 환경 버전 5 기준으로, torchtorchvision 사전 설치되어 있지 않습니다. AI 환경에는 PyTorch, Transformers 등 다양한 기능이 추가되었습니다.
  • 노트북에서는 %pip install(환경 버전 5 이상) 또는 environment.dependencies로, CLI에서는 %uv pip install로 추가 패키지를 설치하세요.

사용할 환경

AI 런타임은 두 개의 관리되는 Python 환경인 표준 환경과 Databricks AI 환경을 제공합니다.

환경 주요 특징 사용 시기
표준 환경 최소; cuda 포함. 환경 버전 5torchtorchvision 를 기준으로 더 이상 사전 설치되지 않습니다. 종속성 스택을 완전히 제어하고 필요한 항목만 설치하려고 합니다.
Databricks AI 환경 인기 있는 ML 프레임워크(PyTorch, 변환기 등)로 미리 로드됨 수동 종속성 관리 없이 학습, 미세 조정 및 실험을 위한 완벽한 환경을 원합니다.

또한 작업 관리자가 AI 런타임용으로 만든 워크스페이스 기본 환경을 사용할 수도 있습니다. 서버리스 GPU 컴퓨팅(AI 런타임)에 대한 빌드를 참조하세요.

노트북에서 환경을 선택하려면 환경 사이드 패널을 열고 기본 환경을 선택하세요:

노트북 환경 사이드 패널에서 기본 환경을 선택하는 방법.

표준 환경(최소 환경)

AI 런타임 작업에 필요한 패키지만 포함하는 최소한의 안정적인 환경입니다. 환경에는 GPU 지원이 포함됩니다 cuda . 환경 버전 5 torchtorchvision 를 기준으로 더 이상 사전 설치되지 않습니다. 작업 부하에 필요한 버전을 %uv pip install 또는 %pip install로 설치하세요. 각 환경 버전에 설치된 패키지는 아래 릴리스 정보를 참조하세요.

최적 대상: 종속성 스택을 완전히 제어하고 필요한 것만 설치하려는 사용자입니다.

선택 방법: 환경 사이드 패널에서 기본 환경으로 Standard v6 를 선택하세요.

다른 버전에 설치된 패키지 버전에 대한 자세한 내용은 릴리스 정보를 참조하세요.

Databricks AI 환경

환경 4 이상에서 사용할 수 있습니다. AI 환경은 GPU의 기계 학습과 관련된 공용 런타임 패키지 및 패키지를 사용하여 표준 환경을 기반으로 합니다. 미리 설치된 패키지는 다음과 같습니다.

  • PyTorch(CUDA 지원)
  • 트랜스포머(Hugging Face)
  • 추가 머신러닝/딥러닝(ML/DL) 종속성

최적 대상: 수동 종속성 관리 없이 워크로드, 미세 조정 및 실험을 위한 완벽한 환경을 원하는 ML 실무자입니다.

선택 방법: 환경 사이드 패널에서 기본 환경으로 AI v6 를 선택하세요.

다른 버전에 설치된 패키지 버전에 대한 자세한 내용은 릴리스 정보를 참조하세요.

추가 패키지 설치

관리형 환경이나 작업 공간 기반 환경 중 하나에서 시작해서 그 위에 자신만의 Python 패키지를 설치할 수 있습니다. 설치 방법은 AI 런타임에 어떻게 연결하느냐에 달려 있습니다.

노트북 속에

노트북 상단에 패키지를 설치하거나 학습 스크립트 %uv pip를 설치하세요. 이 스크립트는 uv 로 설치되며 보다 빠릅니다 %pip. 버전을 고정해 실행이 재현 가능하도록 유지하세요:

%uv pip install "trl==1.1.0"
%uv pip install "transformers==5.5.4"

%pip를 참조하여 각 환경에서 지원하는 버전을 포함한 전체 %uv 및 참조 정보를 확인하세요.

멀티-GPU 워크로드에 @distributed 데코레이터를 사용할 때, .distributed()를 호출하기 전에 설치한 패키지는 자동으로 스냅샷되어 모든 분산 프로세스에 전달됩니다. 설치된 패키지의 총 크기는 15GB를 초과하면 안 됩니다. 자세한 내용은 Notebook에 종속성 추가를 참조하세요.

CLI와 함께

CLI는air 동일한 관리 환경을 사용합니다. environment.version로 하나를 선택한 다음, 워크로드 YAML의 environment.dependencies 아래에 그 위에 추가로 설치할 패키지를 나열하세요. CLI는 UV로 선택한 환경에 이들을 설치해주므로, 별도의 가상 환경을 직접 관리할 필요가 없습니다:

environment:
  version: '6'
  dependencies:
    - trl==1.1.0
    - transformers==5.5.4

대신 Databricks AI 환경에서 시작하려면 databricks_ai_v5를 version와 같은 AI 환경 식별자로 설정하세요. 전체 의존성 형식, 지원되는 설치 플래그, 맞춤형 Docker 이미지 지원에 대해서는 Python 의존성을 참조하세요.

작업 영역 기본 환경

작업 영역 관리자는 서버리스 GPU 컴퓨팅을 위한 작업 영역 기본 환경을 빌드할 수 있으므로 기본 환경 드롭다운 메뉴를 통해 작업 영역의 모든 사용자가 사용할 수 있습니다. 자세한 내용은 서버리스 GPU 컴퓨팅용 빌드(AI 런타임)를 참조하세요.

예약된 워크로드에서 기본 환경을 사용하려면 작업 또는 번들의 environments 블록에서 해당 식별자로 이를 참조하세요. 예를 들어, 이 선언적 자동화 번들 작업은 Databricks AI 환경을 선택합니다:

resources:
  jobs:
    train:
      tasks:
        - task_key: train
          environment_key: default
      environments:
        - environment_key: default
          spec:
            base_environment: databricks_ai_v6

완전한 작업 예제는 Jobs API 및 선언적 자동화 번들로 예약하기를 참조하세요.

환경 캐싱 및 사용자 지정 모듈

환경은 언제 캐시되나요?

AI 런타임은 노트북 환경을 캐시하기 때문에, 노트북을 다시 열 때 패키지를 재설치할 필요가 없습니다. 자세한 내용은 환경 의존성 재설정을 참조하세요.

캐싱은 인터랙티브 노트북에 적용됩니다. air CLI를 통해 실행되거나 작업으로 예약된 워크로드는 이 캐시를 사용하지 않습니다. 실행할 때마다 종속성이 새로 설치됩니다.

모범 사례로, 패키지를 특정 버전에 고정하여 캐시 환경이 유효하게 유지되고 실행 결과가 재현 가능하게 유지되도록 하세요.

사용자 지정 모듈을 가져오면 어떻게 하나요?

다음 단계들은 자신만의 Python 모듈을 사용하는 방법을 보여줍니다.

  1. 코드를 작업 공간에 동기화하세요. Git 저장소를 작업 공간에 복제하여 Git 폴더를 만들거나, 파일을 작업 공간 파일로 직접 업로드할 수 있습니다. 팀 프로젝트용으로는 공유 코드를 아래에 /Workspace/Shared 저장하거나, 개인 개발용으로는 사용자 폴더에 저장하세요. 코드를 Git 폴더에 보관하면 버전 관리가 가능합니다.
  2. 폴더 sys.path 를 추가해서 노트북이나 교육 스크립트 상단에 가져와보세요:
import sys
sys.path.append("/Workspace/Shared/my-project/src")
from my_module import my_function

제한점

AI 런타임에서는 다음 기능을 사용할 수 없습니다.

  • Spark 함수: PySpark 함수를 직접 가져오거나 사용할 수 없습니다. AI 런타임은 Python 전용 환경입니다. Spark는 로컬 런타임으로 사용할 수 없습니다. 그러나 Spark Connect는 데이터 로드에 사용할 수 있습니다. AI 런타임에서 데이터 로드를 참조하세요.
  • Databricks 런타임 ML 라이브러리: 미리 설치된 패키지는 Databricks 런타임 ML을 대체하지 않습니다. Databricks Runtime ML에서 사용할 수 있는 일부 ML 라이브러리는 AI 런타임에 미리 설치되지 않을 수 있습니다.
  • 프라이빗 아티팩트: AI 런타임은 특정 경우에 프라이빗 아티팩트 지원 자세한 내용은 계정 팀에 문의하세요.