Overview

Important

Ez a funkció nyilvános előzetes verzióban van.

Az AI Runtime egy számítási ajánlat a Databricksben, amely mélytanulási számítási feladatokhoz készült, és GPU-támogatást nyújt a Databricks Serverlesshez. Az AI-futtatókörnyezettel egyéni modelleket taníthat be és finomíthat kedvenc keretrendszereivel, és a legkorszerűbb hatékonyságot, teljesítményt és minőséget érheti el. A kiszolgáló nélküli számításnak a Databricks-architektúrába való illeszkedésének áttekintéséért tekintse meg a kiszolgáló nélküli munkaterület architektúráját.

Legfontosabb funkciók

Az AI Runtime ötvözi a kezelt GPU infrastruktúrát egy mélytanulásra tervezett futásidővel:

  • Teljes mértékben felügyelt GPU-infrastruktúra: Kiszolgáló nélküli, rugalmas hozzáférés a GPU-khoz, fürtkonfiguráció, illesztőprogram-kiválasztás vagy automatikus skálázási szabályzatok nem kezelhetők.
  • A mélytanuláshoz dedikált futtatókörnyezet: Válasszon minimális standard környezetet a függőségekkel szemben maximális rugalmasság érdekében, vagy a népszerű ML-keretrendszerekkel előre betöltött teljes körű AI-környezetet.
  • Natívan integrálva van jegyzetfüzetek, feladatok, Unity Catalog és MLflow között a zökkenőmentes fejlesztés, az adathozzáférés és a kísérletkövetés érdekében.

Harver opciók

Minden AI-futtatókörnyezet-gyorsító egyetlen csomópontot épít ki. Az adott csomópont GPU-jainak száma a gyorsító típusától függ:

Gyorsító GPU-k csomópontonként GPU-memória Legjobb a számára Elosztott betanítás
1xA10 1 24 GB Kis és közepes gépi tanulási és mélytanulási feladatok, például klasszikus gépi tanulási modellek vagy kisebb nyelvi modellek finomhangolása Nem támogatott (egyetlen GPU)
1xH100 1 80 GB Azok a számítási feladatok, amelyek 1xA10-nél több GPU-memóriát igényelnek, de nem igényelnek több GPU-s elosztott betanítást, például a közepes méretű nyelvi modellek finomhangolását Nem támogatott (egyetlen GPU)
8xH100 8 GPU-nként 80 GB Nagy méretű AI-számítási feladatok, beleértve a nagy méretű modellek betanítását vagy finomhangolását vagy fejlett mélytanulási feladatok futtatását A @distributed dekorátor gpus=8 használatával támogatott

Tip

Csak az 8xH100 támogatja a többGPU-s elosztott képzést. Egy-GPU munkaterhelésekhez válassz 1xA10-et vagy 1xH100-at a modelled GPU memóriája alapján.

A Databricks az AI Runtime használatát javasolja minden olyan egyéni modellbetanításhoz, amely mélytanulást, nagy léptékű klasszikus számítási feladatokat vagy GPU-kat foglal magában.

Például:

  • LLM finomhangolása (LoRA, QLoRA, teljes finomhangolás)
  • Számítógépes látás (objektumészlelés, képbesorolás)
  • Mélytanuláson alapuló ajánlórendszerek
  • Megerősítő tanulás
  • Mélytanuláson alapuló idősorok előrejelzése

Követelmények

Mielőtt elkezdenéd, győződj meg róla, hogy a munkaterületed megfelel ezeknek a követelményeknek:

  • Munkaterület az alábbi Azure-támogatott régiók egyikében:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • Az AI Runtime előnézetet a munkaterület adminisztrátor beállításain keresztül kell engedélyezni. Lásd: Databricks előzetes verzióinak kezelése.

Limitations

Tartsd szem előtt a következő korlátokat, amikor AI Runtime munkaterhelést tervezel:

  • Az AI-futtatókörnyezet csak az A10- és H100-gyorsítókat támogatja.
  • Az AI Runtime nem támogatja a FedRAMP High vagy DoD IL5 szabványok megfelelőségi biztonsági profilját .
  • Az Környezetek panelen a függőségek hozzáadása nem támogatott az AI futtatókörnyezet ütemezett feladatai számára. Telepítse a függőségeket programozott módon %pip install a jegyzetfüzetben.
  • Az AI-futtatókörnyezet ütemezett feladatai esetében a jegyzetfüzethez társított nem kompatibilis csomagverziók automatikus helyreállítási viselkedése nem támogatott.
  • Az AI-futtatókörnyezeti kapcsolatok létrehozására tett kísérletek interaktív jegyzetfüzetek esetén 15 perc, jegyzetfüzet-feladatok vagy CLI-feladatok esetén pedig 24 óra után megszakadnak. A csatlakoztatott jegyzetfüzet-munkamenetek és a jegyzetfüzetes feladatok legfeljebb két napig futhatnak, míg a CLI-feladatok legfeljebb 14 napig futhatnak. Hosszú ideig futó modellbetanítási feladatoknál alkalmazzon ellenőrzőpontmentést, és indítsa újra a feladatot, amikor az eléri a maximális futási időt.
  • Az AI-futtatókörnyezet igény szerinti hozzáférést biztosít a GPU-erőforrásokhoz. Bár ez egyszerű, rugalmas hozzáféréshez vezet a GPU-khoz, előfordulhatnak olyan időszakok, amikor a kapacitás korlátozott vagy nem érhető el a régióban.
  • Az AI-futtatókörnyezet kihasználja a régiók közötti GPU-kat bizonyos esetekben a nagy igényű időszakokban. Előfordulhat, hogy az ilyen használat kimenő költségekkel jár, és a régiók közötti hálózati kapcsolat bizonyos esetekben korlátozott lehet.

Csatlakozás az AI-futtatási környezethez

Az AI-futtatókörnyezethez interaktívan csatlakozhat jegyzetfüzetekből, egy IDE-terminálból egy SSH-alagút, ütemezett feladatok, a Jobs API és a Deklaratív automatizálási csomagok használatával. A lépésről lépésre szóló utasításokért lásd: Kapcsolódás az AI Runtime-hoz notebookból.

Környezet beállítása

Az AI Runtime két felügyelt Python környezetet kínál: egy minimális Standard környezetet és egy teljes funkcionalitású Databricks AI-környezetet, amely előre betöltve van olyan népszerű ML-keretrendszerekkel, mint a PyTorch és a Transformers. A környezet kiválasztásával, a gyorsítótárazási viselkedéssel, az egyéni modulok importálásával és az ismert korlátozásokkal kapcsolatos részletekért lásd : A környezet beállítása.

Tip

Válaszd a Standard környezetet a függőségi stack teljes ellenőrzéséhez, vagy a Databricks AI környezetet, hogy elkerüld a gyakori keretrendszerek, például a PyTorch és a Transformers telepítését.

Adatok betöltése az AI futtatókörnyezetben

A zökkenőmentes működéshez elengedhetetlen az adathozzáférés működése az AI-futtatókörnyezetben. További információ: Adatok betöltése az AI-futtatókörnyezetben.

Elosztott betanítás

Az AI-futtatókörnyezet támogatja az elosztott betanítást több GPU-n azon a csomóponton, amelyhez a jegyzetfüzet csatlakozik. @distributed A Python API-ból származó serverless_gpu dekoratőrrel több GPU-s számítási feladatokat indíthat el PyTorch DDP, FSDP vagy DeepSpeed használatával minimális konfigurációval. További információ: Elosztott betanítás jegyzetfüzetekben.

Tip

Ellenőrizd a munkaterhelésedet egyetlen GPU-n, mielőtt a dekorátorral 8xH100-ra@distributed skáláznád.

Ray MI-futtatókörnyezetben

Az AI Runtime támogatja a Ray-t elosztott GPU munkaterhelésekhez, beleértve a Ray Core-t, Ray Data-t, Ray Train-t és Ray Tune-ot. Futtathatsz egycsomópontos és többcsomópontos Ray feladatokat szerver nélküli GPU számításon klaszterrendszer nélkül. Részletekért és példákért lásd: Ray az AI Runtime-ról.

Kísérletkövetés és megfigyelhetőség

Az MLflow integrációról, naplók megtekintéséről és GPU monitorozásáról lásd: Kísérleti követés és megfigyelhetőség. A modell-ellenőrzőpontokkal kapcsolatban lásd: Javítsa a betanítási teljesítményt és ellenállóképességet az AI Runtime-on.

Képzési feladatok gyártása

Telepíts egy AI Runtime-munkaterhelést Declarative Automation Bundle-ökkel, hogy saját betanítási kódot futtass, többfeladatos feladatokat építs, amelyek GPU- és CPU-feladatokat kombinálnak, folyamatokat ütemezz, és a fejlesztői környezetből éles környezetbe léptesd elő őket. Lásd: A betanítási munkaterhelések élesítése.

Genie Code a mély tanuláshoz

A Genie Code segíthet mélytanulási munkaterhelések fejlesztésében és hibakeresésében AI Runtime-on. Képes elosztott betanítási kódot generálni, környezeti és függőségi problémákat oldani, valamint GPU és elosztott munkaterhelési hibákat vizsgálni. Lásd: A Genie Code használata AI Runtime-környezettel.

Guides

A klasszikus számítási feladatokból, például jegyzetfüzetekből és hibaelhárításból való migrálásról az AI-futtatókörnyezet felhasználói útmutatóiban olvashat. Ha egy meglévő Slurm képzési munkaterhelést át akarsz helyezni AI Runtime-ra, lásd: Migrate from Slurm.