Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Important
Tato funkce je ve verzi Public Preview.
AI Runtime je výpočetní nabídka v Databricks určená pro úlohy hlubokého učení a přináší podporu GPU pro Bezserverovou službu Databricks. AI Runtime můžete použít k trénování a vyladění vlastních modelů pomocí oblíbených architektur a získání špičkové efektivity, výkonu a kvality. Přehled toho, jak bezserverové výpočetní prostředí zapadá do architektury Databricks, najdete v tématu Architektura bezserverového pracovního prostoru.
Klíčové funkce
AI Runtime kombinuje řízenou infrastrukturu GPU s runtime vytvořeným pro hluboké učení:
- Plně spravovaná infrastruktura GPU: Bezserverový, flexibilní přístup k grafickým procesorům a bez konfigurace clusteru, výběru ovladačů nebo zásad automatického škálování pro správu.
- Běhové prostředí určené pro hluboké učení: Zvolte buď minimální prostředí Standard pro maximální flexibilitu při správě závislostí, nebo plnohodnotné prostředí pro AI s předinstalovanými oblíbenými frameworky pro strojové učení.
- Nativní integrace mezi poznámkovými bloky, úlohami, katalogem Unity a MLflow pro bezproblémový vývoj, přístup k datům a sledování experimentů.
Hardwarové možnosti
Všechny akcelerátory modulu runtime AI zřizují jeden uzel. Počet GPU na daném uzlu závisí na typu akcelerátoru:
| akcelerátor | GPU na uzel | Paměť GPU | Nejvhodnější pro | Distribuované trénování |
|---|---|---|---|---|
| 1xA10 | 1 | 24 GB | Malé až střední úlohy STROJOVÉho učení a hlubokého učení, jako jsou klasické modely ML nebo jemné ladění menších jazykových modelů | Nepodporuje se (jeden GPU) |
| 1xH100 | 1 | 80 GB | Úlohy, které potřebují více paměti GPU než 1xA10, ale nevyžadují distribuované trénování s více GPU, jako je vyladění středně velkých jazykových modelů | Nepodporuje se (jeden GPU) |
| 8xH100 | 8 | 80 GB na GPU | Rozsáhlé úlohy umělé inteligence, včetně trénování nebo vyladění masivních modelů nebo spouštění pokročilých úloh hlubokého učení | Podporováno pomocí dekorátoru @distributed s gpus=8 |
Tip
Pouze 8xH100 podporuje distribuované trénování s více GPU. Pro workloady s jedním GPU zvolte 1xA10 nebo 1xH100 podle GPU paměti, kterou váš model potřebuje.
Doporučené případy použití
Databricks doporučuje AI Runtime pro všechny případy použití vlastních modelů, které zahrnují hluboké učení, rozsáhlé klasické úlohy nebo GPU.
Příklady:
- Vyladění LLM (LoRA, QLoRA, úplné vyladění)
- Počítačové zpracování obrazu (rozpoznávání objektů, klasifikace obrázků)
- Systémy pro doporučování založené na hlubokém učení
- Posilované učení
- Prognózování časových řad založených na hlubokém učení
Požadavky
Než začnete, ověřte si, že vaše pracovní plocha splňuje tyto požadavky:
- Pracovní prostor v jedné z následujících oblastí podporovaných Azure:
centraluseastuseastus2northcentraluswestcentraluswestuswestus3
- Náhled AI Runtime musí být povolen v nastavení administrátora pracovního prostoru. Viz Správa náhledů Databricks.
Limitations
Při plánování AI Runtime pracovní zátěže mějte na paměti následující omezení:
- AI Runtime podporuje pouze akcelerátory A10 a H100.
- AI Runtime nepodporuje profil zabezpečení dodržování předpisů pro standardy FedRAMP High nebo DoD IL5.
- Přidání závislostí pomocí panelu Prostředí není podporováno pro naplánované úlohy modulu runtime AI. Místo toho nainstalujte závislosti programově pomocí
%pip installve vašem poznámkovém bloku. - U pravidelně spouštěných úloh v prostředí AI Runtime není podporováno automatické obnovení pro nekompatibilní verze balíčků, které jsou přidruženy k vašemu poznámkovému bloku.
- Pokusy o připojení k AI Runtime se ukončí po 15 minutách u interaktivních notebooků a po 24 hodinách u úloh notebooku nebo úloh CLI. Připojené relace poznámkového bloku a úlohy poznámkového bloku mohou běžet až dva dny a úlohy CLI až 14 dnů. Pro dlouho běžící úlohy trénování modelu implementujte ukládání kontrolních bodů a po dosažení maximální doby běhu úlohu restartujte.
- AI Runtime poskytuje přístup k prostředkům GPU na vyžádání. I když to vede ke snadnému, flexibilnímu přístupu k grafickým procesorům, můžou existovat období, kdy je kapacita ve vaší oblasti omezená nebo nedostupná.
- AI Runtime využívá gpu napříč oblastmi v určitých případech v době vysoké poptávky. S takovým využitím můžou být spojené náklady na výchozí přenos dat a připojení k síti napříč oblastmi může být v určitých časech omezené.
Připojit se k AI runtime
K AI Runtime se můžete interaktivně připojit z notebooků, z terminálu IDE pomocí tunelu SSH, z naplánovaných úloh, prostřednictvím rozhraní Jobs API a z deklarativních automatizačních balíčků. Pro podrobné instrukce viz Připojit se k AI Runtime z notebooku.
Nastavení prostředí
AI Runtime nabízí dvě spravovaná prostředí pro Python: minimální prostředí Standard a plně vybavené prostředí Databricks AI, které je předinstalované s oblíbenými frameworky pro strojové učení, jako jsou PyTorch a Transformers. Podrobnosti o výběru prostředí, chování při ukládání do mezipaměti, importu vlastních modulů a známých omezení najdete v tématu Nastavení prostředí.
Tip
Vyberte si prostředí Standard pro plnou kontrolu nad sadou závislostí nebo prostředí Databricks AI, abyste nemuseli instalovat běžné frameworky, jako jsou PyTorch a Transformers.
Načtení dat do AI Runtime
Pochopení fungování přístupu k datům v prostředí AI Runtime je nezbytné pro bezproblémové prostředí. Podrobnosti najdete v tématu Načtení dat v prostředí AI Runtime.
Distribuované trénování
AI Runtime podporuje distribuované trénování napříč několika GPU na jednom uzlu, ke kterému je notebook připojený.
@distributed Pomocí dekorátoru serverless_gpu z rozhraní API Python můžete spouštět úlohy s více GPU pomocí PyTorch DDP, FSDP nebo DeepSpeed s minimální konfigurací. Podrobnosti najdete v tématu Distribuované trénování v poznámkových blocích.
Tip
Ověřte si pracovní zátěž na jedné GPU, než ji s dekorátorem @distributed naškálujete na 8xH100.
Ray pro běhové prostředí AI
AI Runtime podporuje Ray pro distribuované GPU pracovní zátěže, včetně Ray Core, Ray Data, Ray Train a Ray Tune. V serverless GPU výpočetním prostředí můžete spouštět jednouzlové i víceuzlové úlohy Ray bez nutnosti nastavovat cluster. Pro podrobnosti a příklady viz Ray on AI Runtime.
Sledování experimentů a pozorovatelnost
Informace o integraci MLflow, zobrazení protokolů a správě kontrolních bodů modelu najdete v tématu Sledování experimentů a pozorovatelnost.
Převést trénovací úlohy do produkce
Nasazujte AI Runtime workload s Declarative Automation Bundles pro spuštění vlastního tréninkového kódu, tvorbu multitaskových úloh kombinujících GPU a CPU úkoly, plánování pipeline a povýšení z vývoje do produkce. Viz Zavedení trénovacích úloh do produkce.
Genie Code pro hluboké učení
Genie Code může pomoci vyvíjet a řešit problémy s deep learning workloady v AI Runtime. Dokáže generovat distribuovaný tréninkový kód, řešit problémy s prostředím a závislostmi a vyšetřovat selhání GPU a distribuované pracovní zátěže. Viz Použití Genie Code v běhovém prostředí AI.
Guides
Informace o migraci z klasických úloh, například poznámkových bloků a řešení potíží, najdete v uživatelských příručkách k prostředí AI Runtime.