AI-futtatókörnyezet

Fontos

Ez a funkció nyilvános előzetes verzióban van.

Az AI Runtime egy számítási ajánlat a Databricksben, amely mélytanulási számítási feladatokhoz készült, és GPU-támogatást nyújt a Databricks Serverlesshez. Az AI-futtatókörnyezettel egyéni modelleket taníthat be és finomíthat kedvenc keretrendszereivel, és a legkorszerűbb hatékonyságot, teljesítményt és minőséget érheti el. A kiszolgáló nélküli számításnak a Databricks-architektúrába való illeszkedésének áttekintéséért tekintse meg a kiszolgáló nélküli munkaterület architektúráját.

Legfontosabb funkciók

  • Teljes mértékben felügyelt GPU-infrastruktúra: Kiszolgáló nélküli, rugalmas hozzáférés a GPU-khoz, fürtkonfiguráció, illesztőprogram-kiválasztás vagy automatikus skálázási szabályzatok nem kezelhetők.
  • A mélytanuláshoz dedikált futtatókörnyezet: Válasszon minimális standard környezetet a függőségekkel szemben maximális rugalmasság érdekében, vagy a népszerű ML-keretrendszerekkel előre betöltött teljes körű AI-környezetet.
  • Natívan integrálva van jegyzetfüzetek, feladatok, Unity Catalog és MLflow között a zökkenőmentes fejlesztés, az adathozzáférés és a kísérletkövetés érdekében.
  • Megfelelőségi támogatás: A legtöbb megfelelőségi szabványt támogatja. A támogatott szabványokért és kivételekért tekintse meg a megfelelőségi biztonsági profilt.
  • Hozzáférés a webes terminálhoz: Futtasson shellparancsokat, figyelje a GPU-kihasználtságot a nvidia-smi használatával, és kezelje a fájlokat közvetlenül a számítási erőforráson, ha a szerver nélküli GPU-környezet 5-ös vagy újabb verziójához csatlakozik. Lásd: Shell-parancsok végrehajtása Azure Databricks webes terminálban.

Hardverbeállítások

Minden AI-futtatókörnyezet-gyorsító egyetlen csomópontot épít ki. Az adott csomópont GPU-jainak száma a gyorsító típusától függ:

Gyorsító GPU-k csomópontonként GPU-memória A következőkre alkalmas Elosztott betanítás
1xA10 1 24 GB Kis és közepes gépi tanulási és mélytanulási feladatok, például klasszikus gépi tanulási modellek vagy kisebb nyelvi modellek finomhangolása Nem támogatott (egyetlen GPU)
1xH100 1 80 GB Azok a számítási feladatok, amelyek 1xA10-nél több GPU-memóriát igényelnek, de nem igényelnek több GPU-s elosztott betanítást, például a közepes méretű nyelvi modellek finomhangolását Nem támogatott (egyetlen GPU)
8xH100 8 GPU-nként 80 GB Nagy méretű AI-számítási feladatok, beleértve a nagy méretű modellek betanítását vagy finomhangolását vagy fejlett mélytanulási feladatok futtatását A @distributed dekorátor gpus=8 használatával támogatott

A Databricks az AI Runtime használatát javasolja minden olyan egyéni modellbetanításhoz, amely mélytanulást, nagy léptékű klasszikus számítási feladatokat vagy GPU-kat foglal magában.

Például:

  • LLM finomhangolása (LoRA, QLoRA, teljes finomhangolás)
  • Számítógépes látás (objektumészlelés, képbesorolás)
  • Mélytanuláson alapuló ajánlórendszerek
  • Megerősítő tanulás
  • Mélytanuláson alapuló idősorok előrejelzése

Követelmények

  • Munkaterület az alábbi Azure-támogatott régiók egyikében:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3

Korlátozások

  • Az AI-futtatókörnyezet csak az A10- és H100-gyorsítókat támogatja.
  • Az AI Runtime nem támogatja a FedRAMP High vagy DoD IL5 szabványok megfelelőségi biztonsági profilját . Minden egyéb megfelelőségi szabvány támogatott.
  • Az Környezetek panelen a függőségek hozzáadása nem támogatott az AI futtatókörnyezet ütemezett feladatai számára. Telepítse a függőségeket programozott módon %pip install a jegyzetfüzetben.
  • Az AI-futtatókörnyezet ütemezett feladatai esetében a jegyzetfüzethez társított nem kompatibilis csomagverziók automatikus helyreállítási viselkedése nem támogatott.
  • Az AI-futtatókörnyezeti kapcsolatok létrehozására tett kísérletek interaktív jegyzetfüzetek esetén 15 perc, jegyzetfüzet-feladatok vagy CLI-feladatok esetén pedig 24 óra után megszakadnak. A kapcsolt jegyzetfüzetek és jegyzetfüzetes feladatok akár hét napig is működhetnek, míg a CLI feladatok akár 14 napig is működhetnek. Hosszú távú modellképzési feladatoknál hajtsd végre ellenőrzőpontot, és indítsd újra a munkát, amint elérte a maximális futási időt.
  • Az AI-futtatókörnyezet igény szerinti hozzáférést biztosít a GPU-erőforrásokhoz. Bár ez egyszerű, rugalmas hozzáféréshez vezet a GPU-khoz, előfordulhatnak olyan időszakok, amikor a kapacitás korlátozott vagy nem érhető el a régióban.
  • Az AI-futtatókörnyezet kihasználja a régiók közötti GPU-kat bizonyos esetekben a nagy igényű időszakokban. Előfordulhat, hogy az ilyen használat kimenő költségekkel jár, és a régiók közötti hálózati kapcsolat bizonyos esetekben korlátozott lehet.

Csatlakozás az AI-futtatási környezethez

Az AI-futtatókörnyezethez interaktívan csatlakozhat jegyzetfüzetekből, egy IDE-terminálból egy SSH-alagút, ütemezett feladatok, a Jobs API és a Deklaratív automatizálási csomagok használatával. Részletes útmutatásért tekintse meg a Csatlakozás az AI-futtatókörnyezethez című témakört.

Környezet beállítása

Az AI Runtime két felügyelt Python környezetet kínál: egy minimális Standard környezetet és egy teljes funkcionalitású Databricks AI-környezetet, amely előre betöltve van olyan népszerű ML-keretrendszerekkel, mint a PyTorch és a Transformers. A környezet kiválasztásával, a gyorsítótárazási viselkedéssel, az egyéni modulok importálásával és az ismert korlátozásokkal kapcsolatos részletekért lásd : A környezet beállítása.

Adatok betöltése az AI futtatókörnyezetben

A zökkenőmentes működéshez elengedhetetlen az adathozzáférés működése az AI-futtatókörnyezetben. További információ: Adatok betöltése az AI-futtatókörnyezetben.

Elosztott betanítás

Az AI-futtatókörnyezet támogatja az elosztott betanítást több GPU-n azon a csomóponton, amelyhez a jegyzetfüzet csatlakozik. @distributed A Python API-ból származó serverless_gpu dekoratőrrel több GPU-s számítási feladatokat indíthat el PyTorch DDP, FSDP vagy DeepSpeed használatával minimális konfigurációval. További információ: Elosztott betanítás jegyzetfüzetekben.

Ray MI-futtatókörnyezetben

Az AI Runtime támogatja a Ray-t elosztott GPU munkaterhelésekhez, beleértve a Ray Core-t, Ray Data-t, Ray Train-t és Ray Tune-ot. Futtathatsz egycsomópontos és többcsomópontos Ray feladatokat szerver nélküli GPU számításon klaszterrendszer nélkül. Részletekért és példákért lásd: Ray az AI Runtime-ról.

Kísérletkövetés és megfigyelhetőség

Az MLflow-integrációval, a naplók megtekintésével és a modell ellenőrzőpont-kezelésével kapcsolatban lásd: Kísérletkövetés és megfigyelhetőség.

Képzési feladatok gyártása

Telepíts egy AI Runtime-munkaterhelést Declarative Automation Bundle-ökkel, hogy saját betanítási kódot futtass, többfeladatos feladatokat építs, amelyek GPU- és CPU-feladatokat kombinálnak, folyamatokat ütemezz, és a fejlesztői környezetből éles környezetbe léptesd elő őket. Lásd: A betanítási munkaterhelések élesítése.

Genie Code a mély tanuláshoz

A Genie Code segíthet mélytanulási munkaterhelések fejlesztésében és hibakeresésében AI Runtime-on. Képes elosztott betanítási kódot generálni, környezeti és függőségi problémákat oldani, valamint GPU és elosztott munkaterhelési hibákat vizsgálni. Lásd: A Genie Code használata AI Runtime-környezettel.

Guides

A klasszikus számítási feladatokból, például jegyzetfüzetekből és hibaelhárításból való migrálásról az AI-futtatókörnyezet felhasználói útmutatóiban olvashat.