Overview

Important

Tato funkce je ve verzi Public Preview.

AI Runtime je výpočetní nabídka v Databricks určená pro úlohy hlubokého učení a přináší podporu GPU pro Bezserverovou službu Databricks. AI Runtime můžete použít k trénování a vyladění vlastních modelů pomocí oblíbených architektur a získání špičkové efektivity, výkonu a kvality. Přehled toho, jak bezserverové výpočetní prostředí zapadá do architektury Databricks, najdete v tématu Architektura bezserverového pracovního prostoru.

Klíčové funkce

AI Runtime kombinuje řízenou infrastrukturu GPU s runtime vytvořeným pro hluboké učení:

  • Plně spravovaná infrastruktura GPU: Bezserverový, flexibilní přístup k grafickým procesorům a bez konfigurace clusteru, výběru ovladačů nebo zásad automatického škálování pro správu.
  • Běhové prostředí určené pro hluboké učení: Zvolte buď minimální prostředí Standard pro maximální flexibilitu při správě závislostí, nebo plnohodnotné prostředí pro AI s předinstalovanými oblíbenými frameworky pro strojové učení.
  • Nativní integrace mezi poznámkovými bloky, úlohami, katalogem Unity a MLflow pro bezproblémový vývoj, přístup k datům a sledování experimentů.

Hardwarové možnosti

Všechny akcelerátory modulu runtime AI zřizují jeden uzel. Počet GPU na daném uzlu závisí na typu akcelerátoru:

akcelerátor GPU na uzel Paměť GPU Nejvhodnější pro Distribuované trénování
1xA10 1 24 GB Malé až střední úlohy STROJOVÉho učení a hlubokého učení, jako jsou klasické modely ML nebo jemné ladění menších jazykových modelů Nepodporuje se (jeden GPU)
1xH100 1 80 GB Úlohy, které potřebují více paměti GPU než 1xA10, ale nevyžadují distribuované trénování s více GPU, jako je vyladění středně velkých jazykových modelů Nepodporuje se (jeden GPU)
8xH100 8 80 GB na GPU Rozsáhlé úlohy umělé inteligence, včetně trénování nebo vyladění masivních modelů nebo spouštění pokročilých úloh hlubokého učení Podporováno pomocí dekorátoru @distributed s gpus=8

Tip

Pouze 8xH100 podporuje distribuované trénování s více GPU. Pro workloady s jedním GPU zvolte 1xA10 nebo 1xH100 podle GPU paměti, kterou váš model potřebuje.

Databricks doporučuje AI Runtime pro všechny případy použití vlastních modelů, které zahrnují hluboké učení, rozsáhlé klasické úlohy nebo GPU.

Příklady:

  • Vyladění LLM (LoRA, QLoRA, úplné vyladění)
  • Počítačové zpracování obrazu (rozpoznávání objektů, klasifikace obrázků)
  • Systémy pro doporučování založené na hlubokém učení
  • Posilované učení
  • Prognózování časových řad založených na hlubokém učení

Požadavky

Než začnete, ověřte si, že vaše pracovní plocha splňuje tyto požadavky:

  • Pracovní prostor v jedné z následujících oblastí podporovaných Azure:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • Náhled AI Runtime musí být povolen v nastavení administrátora pracovního prostoru. Viz Správa náhledů Databricks.

Limitations

Při plánování AI Runtime pracovní zátěže mějte na paměti následující omezení:

  • AI Runtime podporuje pouze akcelerátory A10 a H100.
  • AI Runtime nepodporuje profil zabezpečení dodržování předpisů pro standardy FedRAMP High nebo DoD IL5.
  • Přidání závislostí pomocí panelu Prostředí není podporováno pro naplánované úlohy modulu runtime AI. Místo toho nainstalujte závislosti programově pomocí %pip install ve vašem poznámkovém bloku.
  • U pravidelně spouštěných úloh v prostředí AI Runtime není podporováno automatické obnovení pro nekompatibilní verze balíčků, které jsou přidruženy k vašemu poznámkovému bloku.
  • Pokusy o připojení k AI Runtime se ukončí po 15 minutách u interaktivních notebooků a po 24 hodinách u úloh notebooku nebo úloh CLI. Připojené relace poznámkového bloku a úlohy poznámkového bloku mohou běžet až dva dny a úlohy CLI až 14 dnů. Pro dlouho běžící úlohy trénování modelu implementujte ukládání kontrolních bodů a po dosažení maximální doby běhu úlohu restartujte.
  • AI Runtime poskytuje přístup k prostředkům GPU na vyžádání. I když to vede ke snadnému, flexibilnímu přístupu k grafickým procesorům, můžou existovat období, kdy je kapacita ve vaší oblasti omezená nebo nedostupná.
  • AI Runtime využívá gpu napříč oblastmi v určitých případech v době vysoké poptávky. S takovým využitím můžou být spojené náklady na výchozí přenos dat a připojení k síti napříč oblastmi může být v určitých časech omezené.

Připojit se k AI runtime

K AI Runtime se můžete interaktivně připojit z notebooků, z terminálu IDE pomocí tunelu SSH, z naplánovaných úloh, prostřednictvím rozhraní Jobs API a z deklarativních automatizačních balíčků. Pro podrobné instrukce viz Připojit se k AI Runtime z notebooku.

Nastavení prostředí

AI Runtime nabízí dvě spravovaná prostředí pro Python: minimální prostředí Standard a plně vybavené prostředí Databricks AI, které je předinstalované s oblíbenými frameworky pro strojové učení, jako jsou PyTorch a Transformers. Podrobnosti o výběru prostředí, chování při ukládání do mezipaměti, importu vlastních modulů a známých omezení najdete v tématu Nastavení prostředí.

Tip

Vyberte si prostředí Standard pro plnou kontrolu nad sadou závislostí nebo prostředí Databricks AI, abyste nemuseli instalovat běžné frameworky, jako jsou PyTorch a Transformers.

Načtení dat do AI Runtime

Pochopení fungování přístupu k datům v prostředí AI Runtime je nezbytné pro bezproblémové prostředí. Podrobnosti najdete v tématu Načtení dat v prostředí AI Runtime.

Distribuované trénování

AI Runtime podporuje distribuované trénování napříč několika GPU na jednom uzlu, ke kterému je notebook připojený. @distributed Pomocí dekorátoru serverless_gpu z rozhraní API Python můžete spouštět úlohy s více GPU pomocí PyTorch DDP, FSDP nebo DeepSpeed s minimální konfigurací. Podrobnosti najdete v tématu Distribuované trénování v poznámkových blocích.

Tip

Ověřte si pracovní zátěž na jedné GPU, než ji s dekorátorem @distributed naškálujete na 8xH100.

Ray pro běhové prostředí AI

AI Runtime podporuje Ray pro distribuované GPU pracovní zátěže, včetně Ray Core, Ray Data, Ray Train a Ray Tune. V serverless GPU výpočetním prostředí můžete spouštět jednouzlové i víceuzlové úlohy Ray bez nutnosti nastavovat cluster. Pro podrobnosti a příklady viz Ray on AI Runtime.

Sledování experimentů a pozorovatelnost

Informace o integraci MLflow, zobrazení protokolů a správě kontrolních bodů modelu najdete v tématu Sledování experimentů a pozorovatelnost.

Převést trénovací úlohy do produkce

Nasazujte AI Runtime workload s Declarative Automation Bundles pro spuštění vlastního tréninkového kódu, tvorbu multitaskových úloh kombinujících GPU a CPU úkoly, plánování pipeline a povýšení z vývoje do produkce. Viz Zavedení trénovacích úloh do produkce.

Genie Code pro hluboké učení

Genie Code může pomoci vyvíjet a řešit problémy s deep learning workloady v AI Runtime. Dokáže generovat distribuovaný tréninkový kód, řešit problémy s prostředím a závislostmi a vyšetřovat selhání GPU a distribuované pracovní zátěže. Viz Použití Genie Code v běhovém prostředí AI.

Guides

Informace o migraci z klasických úloh, například poznámkových bloků a řešení potíží, najdete v uživatelských příručkách k prostředí AI Runtime.