Konfigurera din miljö

Viktigt!

Den här funktionen finns som allmänt tillgänglig förhandsversion.

AI Runtime tillhandahåller två hanterade Python-miljöer för serverlös GPU-beräkning. Standardmiljön inkluderar cuda. Från och med miljöversion 5 torch och torchvision är inte längre förinstallerade. Databricks AI-miljö är förladdad med PyTorch, Transformers och andra ML- och djupinlärningsramverk. Välj Standard-miljön för fullständig kontroll över din beroendestack eller AI-miljön för en träningskonfiguration som är redo att användas. Du kan börja från vilken miljö som helst och installera fler paket själv.

Tip

  • Välj Standardmiljön för full kontroll över beroenden, eller Databricks AI-miljö för en färdig ML-stack.
  • Standard inkluderar cuda. Från och med miljöversion 5 är torch och torchvision inte förinstallerade. AI-miljön lägger till PyTorch, Transformers och fler.
  • Installera fler paket med %uv pip install (miljöversion 5 eller senare) eller %pip install i en anteckningsbok, eller med environment.dependencies i CLI:n.

Vilken miljö som ska användas

AI Runtime erbjuder två hanterade Python miljöer, standardmiljön och Databricks AI-miljön.

Miljö Viktiga egenskaper När det bör användas
Standardmiljö Minimal; innehåller cuda. Från och med miljöversion 5torch och torchvision är inte längre förinstallerade. Du vill ha fullständig kontroll över din beroendestack och föredrar att bara installera det du behöver
Databricks AI-miljö Förinstallerat med populära ML-ramverk (PyTorch, Transformatorer med mera) Du vill ha en fullständig miljö för träning, finjustering och experimentering utan manuell beroendehantering

Du kan också använda en arbetsytsbasmiljö som en arbetsplatsadministratör har byggt för AI Runtime. Se Skapa för serverlös GPU-beräkning (AI Runtime).

För att välja en miljö i en anteckningsbok, öppna sidopanelen Miljö och välj en basmiljö:

Välja en basmiljö i anteckningsbokens sidopanel Miljö.

Standardmiljö (minsta miljö)

En minimal, stabil miljö som endast innehåller de paket som krävs för AI Runtime-drift. Miljön innehåller cuda för GPU-stöd. Från och med miljöversion 5 torch och torchvision är inte längre förinstallerade. Installera de versioner din arbetsbelastning behöver med %uv pip install eller %pip install. Information om de paket som är installerade i respektive miljöversion finns i versionsinformationen nedan.

Bäst för: Användare som vill ha fullständig kontroll över sin beroendestack och föredrar att bara installera det de behöver.

För att välja: I sidopanelen Miljö , välj Standard v6 som din basmiljö.

För mer information om installerade paketversioner i olika versioner, se versionsinformation:

Databricks AI-miljö

Tillgänglig i miljö 4 och senare. AI-miljön bygger på standardmiljön med vanliga körningspaket och paket som är specifika för maskininlärning på GPU:er. Förinstallerade paket omfattar:

  • PyTorch (med CUDA-stöd)
  • Transformatorer (Hugging Face)
  • Och ytterligare ML/DL-beroenden

Bäst för: ML-utövare som vill ha en fullständig miljö för träningsarbetsbelastningar, finjustering och experimentering utan manuell beroendehantering.

För att välja: I sidopanelen Miljö , välj AI v6 som din basmiljö.

För mer information om installerade paketversioner i olika versioner, se versionsinformation:

Installera ytterligare paket

Du kan börja från antingen en hanterad miljö eller en arbetsmiljöbas och installera dina egna Python-paket ovanpå det. Hur du installerar dem beror på hur du ansluter till AI Runtime.

I en anteckningsbok

Installera paket högst upp i din anteckningsbok eller träningsskript med %uv pip, som installeras med UV och är snabbare än %pip. Pin-versioner så att löpningar förblir reproducerbara:

%uv pip install "trl==1.1.0"
%uv pip install "transformers==5.5.4"

För fullständig %pip information och %uv pip referens, inklusive vilka miljöversioner som stöder varje, se Hantera bibliotek med %uv kommandon.

När du använder decoratorn @distributed för multi-GPU-arbetsbelastningar blir paket du installerar innan du anropar .distributed() automatiskt snapshotta och spridda till alla distribuerade processer. Den totala storleken på installerade paket får inte överstiga 15 GB. Mer information finns i Lägga till beroenden i notebook-filen.

Via CLI

air CLI använder samma hanterade miljöer. Välj ett med environment.version, och lista sedan paketen som ska installeras ovanpå det under environment.dependencies i din arbetsbelastning YAML. CLI installerar dem i den valda miljön med UV, så du hanterar inte en separat virtuell miljö själv:

environment:
  version: '6'
  dependencies:
    - trl==1.1.0
    - transformers==5.5.4

För att börja från Databricks AI-miljö istället, sätt version istället till en AI-miljöidentifierare såsom databricks_ai_v5. För det fullständiga beroendeformatet, stödda installationsflaggor och stöd för anpassade Docker-bilder, se Python-beroenden.

Basmiljöer för arbetsytor

En arbetsyteadministratör kan skapa en basmiljö för arbetsytan för serverlös GPU-beräkning, vilket gör den tillgänglig för alla användare på arbetsytan via listrutan Basmiljö . Mer information finns i Skapa för serverlös GPU-beräkning (AI Runtime).

För att använda en basmiljö i en schemalagd arbetsbelastning, referera till den med dess identifierare i blocket environments av ett jobb eller paket. Till exempel väljer den här aktiviteten Declarative Automation Bundles Databricks AI-miljön:

resources:
  jobs:
    train:
      tasks:
        - task_key: train
          environment_key: default
      environments:
        - environment_key: default
          spec:
            base_environment: databricks_ai_v6

För ett fullständigt exempel på ett jobb, se Schemaläggning med Jobs API och deklarativa automationspaket.

Miljöcachelagring och anpassade moduler

När cachelagras miljöer?

AI Runtime cachar din notebooks miljö, så när du öppnar den igen behöver du inte installera om paket. För detaljer, se Återställ miljöberoenden.

Caching gäller interaktiva anteckningsböcker. Arbetslaster som körs via air CLI eller som schemaläggs som jobb använder inte den här cachen; varje körning installerar sina beroenden på nytt.

Som en god praxis bör du låsa paket till en specifik version så att din cachade miljö förblir giltig och dina körningar förblir reproducerbara.

Hur importerar jag anpassade moduler?

Följande steg visar hur du använder dina egna Python-moduler.

  1. Synkronisera din kod med arbetsytan. Klona ett Git-arkiv in i arbetsytan med en Git-mapp, eller ladda upp filerna direkt som arbetsytfiler. Spara delad kod under /Workspace/Shared för teamprojekt, eller i en användarmapp för personlig utveckling. Att ha koden i en Git-mapp håller den versionskontrollerad.
  2. Lägg till mappen i sys.path och importera den högst upp i din notebook eller ditt träningsskript:
import sys
sys.path.append("/Workspace/Shared/my-project/src")
from my_module import my_function

Begränsningar

Följande funktioner är inte tillgängliga på AI Runtime:

  • Spark-funktioner: Du kan inte importera eller använda PySpark-funktioner direkt. AI Runtime är en körmiljö endast för Python; Spark är inte tillgängligt som en lokal körmiljö. Spark Connect är dock tillgängligt för datainläsning. Se Ladda data på AI Runtime.
  • Databricks Runtime ML-bibliotek: Förinstallerade paket ersätter inte Databricks Runtime ML. Vissa ML-bibliotek som är tillgängliga i Databricks Runtime ML kanske inte är förinstallerade på AI Runtime.
  • Privata artefakter: AI Runtime stöder privata artefakter i vissa fall. Kontakta kontoteamet om du vill ha mer information.