Použijte Genie Code s AI Runtime

Important

Tato funkce je ve verzi Public Preview.

Genie Code vám pomáhá vyvíjet a řešit úlohy hlubokého učení v noteboích připojených k AI Runtime. Dokáže generovat distribuovaný tréninkový kód, řešit problémy s prostředím a závislostmi a vyšetřovat selhání zátěže GPU.

Genie Code vytváří a spouští distribuovanou CNN tréninkovou zátěž na osmi H100 GPU v AI Runtime notebooku.

Požadavky

Jak používat Genie Code s AI Runtime:

Začínáme

  1. Otevřete poznámkový blok služby Azure Databricks.

  2. Připojte notebook k AI Runtime. Viz Připojit se k AI runtime.

  3. Otevřete podokno Genie Code.

  4. Popište pracovní zátěž, kterou chcete vyvinout, nebo problém, který chcete vyřešit.

  5. Před schválením si prostudujte navrhovaný plán, změny v předpisech a opatření.

    Important

    Genie Code může dělat chyby. Před jejich spuštěním si prohlédněte generovaný kód, změny prostředí a další navrhované akce. Některé diagnózy vyžadují další logy nebo kontext pracovní zátěže.

S čím může Genie Code pomoct?

Vyvíjejte distribuované tréninkové zátěže

Genie Code dokáže generovat nebo aktualizovat tréninkový kód pro AI Runtime. Může vám pomoci vybrat vhodnou distribuovanou strategii PyTorch, použít @distributed API z balíčku serverless_gpu a aplikovat AI runtime vzory pro načítání dat, checkpointy a sledování MLflow. Pro podrobnosti a příklady API viz Distribuované školení v zápisnících.

Vyřešit problémy s prostředím a závislostí

Genie Code dokáže prohlédnout současné prostředí, rozlišit selhání kompatibility balíčků od změn kódu nebo API a doporučit cílené opravy. Může vám také pomoci vybrat si mezi prostředím Databricks AI a Standard na základě závislostí vaší pracovní zátěže. Pro informace o dostupných prostředích viz Nastavit své prostředí.

Debug GPU a distribuované pracovní zátěže

Genie Code může využívat výstup notebooku a dostupné logy k vyšetřování distribuovaných selhání trénování, komunikačních chyb, zaseknutí tréninku a problémů s pamětí GPU. Může pomoci identifikovat původní selhání a odlišit je od následných chyb na jiných procesech. Pro informace o prohlížení distribuovaných tréninkových logů viz Sledování experimentů a pozorovatelnost.

Příklady výzev

Vyvíjejte distribuované tréninkové zátěže

  • Aktualizujte tento notebook tak, aby spouštěl distribuované trénování na všech osmi GPU H100 v prostředí AI Runtime.
  • Projděte tento poznámkový blok pro distribuované trénování a opravte způsob, jakým používá serverless_gpu a MLflow.
  • "Přizpůsobte tuto tréninkovou zátěž AI Runtime a vysvětlete důležité změny."

Vyřešit problémy s prostředím a závislostí

  • "Tento zápisník přestal fungovat poté, co jsem nainstaloval nový balíček. Prohlédněte si prostředí a zjistěte, zda je problém závislostní nebo změnou API kódu."
  • "Měla by tato zátěž používat Databricks AI nebo standardní prostředí? Zkontrolujte jeho závislosti a doporučte prostředí, než cokoli změníte."
  • "Diagnostikujte tuto chybu kompatibility balíčku a doporučte nejmenší vhodnou změnu."

Debug GPU a distribuované pracovní zátěže

  • "Analyzujte tento neúspěšný distribuovaný tréninkový běh pomocí dostupných výstupů ze všech hodností a identifikujte kořenovou příčinu."
  • "Proč se tato rozptýlená pracovní zátěž zasekne? Použijte výstup z notebooku k doporučení dalšího kroku ladění."
  • "Prozkoumejte toto selhání paměti GPU a doporučte další krok založený na důkazech."

Dodatečné zdroje