Overview

Important

Den här funktionen finns som allmänt tillgänglig förhandsversion.

AI Runtime är ett beräkningserbjudande på Databricks som är avsett för djupinlärningsarbetsbelastningar och ger GPU-stöd för Databricks Serverless. Du kan använda AI Runtime för att träna och finjustera anpassade modeller med hjälp av dina favoritramverk och få toppmodern effektivitet, prestanda och kvalitet. En översikt över hur serverlös beräkning passar in i Databricks-arkitekturen finns i Serverlös arbetsytearkitektur.

Centrala egenskaper

AI Runtime kombinerar hanterad GPU-infrastruktur med en runtime byggd för djupinlärning:

  • Fullständigt hanterad GPU-infrastruktur: Serverlös, flexibel åtkomst till GPU:er och ingen klusterkonfiguration, val av drivrutin eller principer för automatisk skalning att hantera.
  • En körning dedikerad för djupinlärning: Välj antingen en minimal Standard-miljö för maximal flexibilitet över beroenden eller en komplett AI-miljö som är förinstallerad med populära ML-ramverk.
  • Inbyggt integrerat mellan notebook-filer, jobb, Unity Catalog och MLflow för sömlös utveckling, dataåtkomst och experimentspårning.

Hårdvarualternativ

Alla AI Runtime-acceleratorer etablerar en enda nod. Antalet GPU:er på den noden beror på acceleratortypen:

Accelerator GPUs per nod GPU-minne Bäst för Distribuerad träning
1xA10 1 24 GB Små till medelstora ML- och djupinlärningsuppgifter som klassiska ML-modeller eller finjustering av mindre språkmodeller Stöds inte (enskild GPU)
1xH100 1 80 GB Arbetsbelastningar som behöver mer GPU-minne än 1xA10 tillhandahåller men som inte kräver distribuerad träning med flera GPU:er, till exempel finjustering av medelstora språkmodeller Stöds inte (enskild GPU)
8xH100 8 80 GB per GPU Storskaliga AI-arbetsbelastningar, inklusive träning eller finjustering av massiva modeller eller körning av avancerade djupinlärningsuppgifter Stöds vid användning av dekoratören @distributed med gpus=8

Tip

Endast 8xH100 stöder multi-GPU distribuerad träning. För arbetsbelastningar med en GPU, välj 1xA10 eller 1xH100 beroende på vilket GPU-minne din modell behöver.

Databricks rekommenderar AI Runtime för alla träningsfall för anpassade modeller som omfattar djupinlärning, storskaliga klassiska arbetsbelastningar eller GPU:er.

Ett exempel:

  • LLM-finjustering (LoRA, QLoRA, fullständig finjustering)
  • Datorsyn (objektidentifiering, bildklassificering)
  • Djupinlärningsbaserade rekommenderade system
  • Förstärkningsinlärning
  • Prognostisering av djupinlärningsbaserade tidsserier

Krav

Innan du börjar, kontrollera att din arbetsplats uppfyller dessa krav:

  • En arbetsyta i någon av följande Azure regioner som stöds:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • AI Runtime-förhandsvisningen måste aktiveras via workspace admin-inställningarna. Se Hantera Databricks-förhandsvisningar.

Limitations

Tänk på följande begränsningar när du planerar en AI-runtime-arbetsbelastning:

  • AI Runtime stöder endast A10- och H100-acceleratorer.
  • AI Runtime stöder inte efterlevnadssäkerhetsprofilen för FedRAMP High- eller DoD IL5-standarder.
  • Det går inte att lägga till beroenden med hjälp av panelen Miljöer för schemalagda AI Runtime-jobb. Installera beroenden programmatiskt med hjälp av %pip install i din notebook istället.
  • För schemalagda jobb på AI Runtime stöds inte den automatiska återställningsfunktionen för inkompatibla paketversioner som är kopplade till din notebook.
  • AI-runtime-anslutningsförsök avslutas efter 15 minuter för interaktiva anteckningsböcker och efter 24 timmar för anteckningsboksjobb eller CLI-jobb. Sammankopplade anteckningsbokssessioner och anteckningsboksjobb kan pågå i upp till två dagar, och CLI-jobb kan pågå i upp till 14 dagar. För långvariga jobb för modellträning, implementera kontrollpunkter och starta om jobbet när den maximala körtiden har uppnåtts.
  • AI Runtime ger åtkomst på begäran till GPU-resurser. Även om detta leder till enkel och flexibel åtkomst till GPU:er kan det finnas perioder där kapaciteten är begränsad eller otillgänglig i din region.
  • AI Runtime utnyttjar GPU:er mellan regioner i vissa fall under stunder med hög efterfrågan. Det kan finnas utgående kostnader som är kopplade till sådan användning, och nätverksanslutningen mellan regioner kan vara begränsad vid vissa tidpunkter.

Ansluta till AI Runtime

Du kan ansluta till AI Runtime interaktivt från anteckningsböcker, via en IDE-terminal med en SSH-tunnel, schemalagda jobb, Jobs API och deklarativa automatiseringspaket. För steg-för-steg-instruktioner, se Anslut till AI Runtime från en notebook.

Konfigurera miljö

AI Runtime erbjuder två hanterade Python miljöer: en minimal standardmiljö och en komplett Databricks AI-miljö som är förinstallerad med populära ML-ramverk som PyTorch och Transformers. Mer information om hur du väljer en miljö, cachelagringsbeteende, import av anpassade moduler och kända begränsningar finns i Konfigurera din miljö.

Tip

Välj Standard-miljön för full kontroll över din beroendestack, eller Databricks AI-miljö för att slippa installera vanliga ramverk som PyTorch och Transformers.

Ladda data i AI Runtime

Att förstå hur dataåtkomst fungerar på AI Runtime är viktigt för en smidig upplevelse. För detaljer, se Ladda data på AI Runtime.

Distribuerad utbildning

AI Runtime stöder distribuerad träning över flera GPU:er på den nod som din anteckningsbok är ansluten till. @distributed Med hjälp av dekoratören från Python-API:et serverless_gpu kan du starta multi-GPU-arbetsbelastningar med PyTorch DDP, FSDP eller DeepSpeed med minimal konfiguration. Mer information finns i Distribuerad träning i anteckningsböcker.

Tip

Validera din arbetsbelastning på ett enda grafikkort innan du skalar till 8xH100 med dekoratorn @distributed .

Ray på AI-runtime

AI Runtime stöder Ray för distribuerade GPU-arbetsbelastningar, inklusive Ray Core, Ray Data, Ray Train och Ray Tune. Du kan köra Ray-jobb med både enkel nod och flera noder på serverlös GPU-beräkning utan klusteruppsättning. För detaljer och exempel, se Ray on AI Runtime.

Spårning och observerbarhet för experiment

Information om MLflow-integrering, visning av loggar och hantering av modellkontrollpunkter finns i Experimentspårning och observerbarhet.

Gör träningsarbetsbelastningar produktionsklara

Driftsätt en AI-körningsarbetsbelastning med Declarative Automation Bundles för att köra din egen träningskod, bygga fleruppgiftsjobb som kombinerar GPU- och CPU-uppgifter, schemalägga pipelines och flytta från utveckling till produktion. Se Produktionsanpassa träningsarbetsbelastningar.

Genie Code för djupinlärning

Genie Code kan hjälpa till att utveckla och felsöka djupinlärningsarbetsbelastningar på AI Runtime. Den kan generera distribuerad träningskod, lösa miljö- och beroendeproblem samt undersöka fel på GPU och distribuerad arbetsbelastning. Se Använd Genie-kod med AI Runtime.

Guides

Information om migrering från klassiska arbetsbelastningar, exempel notebook-filer och felsökning finns i Användarguider för AI-körning.