Använd Genie Code med AI Runtime

Important

Den här funktionen finns som allmänt tillgänglig förhandsversion.

Genie Code hjälper dig att utveckla och felsöka djupinlärningsarbetsbelastningar i anteckningsböcker kopplade till AI Runtime. Den kan generera distribuerad träningskod, lösa miljö- och beroendeproblem samt undersöka GPU-arbetsbelastningsfel.

Genie Code skapar och kör en distribuerad CNN-träningsbelastning över åtta H100-GPU:er i en AI Runtime-notebook.

Kravspecifikation

För att använda Genie Code med AI Runtime:

Get started

  1. Öppna en Azure Databricks-anteckningsbok.

  2. Anslut anteckningsboken till AI Runtime. Se Anslut till AI-körningsmiljö.

  3. Öppna Genie-kodpanelen.

  4. Beskriv arbetsbelastningen du vill utveckla eller problemet du vill lösa.

  5. Gå igenom den föreslagna planen, kodändringar och åtgärder innan du godkänner dem.

    Important

    Genie Code kan göra misstag. Granska genererad kod, miljöändringar och andra föreslagna åtgärder innan du kör dem. Vissa diagnoser kräver ytterligare loggar eller arbetsbelastningskontext.

Vad kan Genie Code hjälpa till med?

Utveckla distribuerade träningsarbetsbelastningar

Genie Code kan generera eller uppdatera träningskod för AI Runtime. Det kan hjälpa dig att välja en lämplig PyTorch-distribuerad strategi, använda API:et @distributed från paketet serverless_gpu och tillämpa AI-runtimemönster för datainsamling, checkpointing och MLflow-spårning. För API-detaljer och exempel, se Distribuerad träning i anteckningsböcker.

Lös miljö- och beroendeproblem

Genie Code kan inspektera den aktuella miljön, skilja på paketkompatibla fel från kod- eller API-ändringar och rekommendera riktade fixar. Det kan också hjälpa dig att välja mellan Databricks AI och Standard-miljöer baserat på din arbetsbelastnings beroenden. För information om tillgängliga miljöer, se Sätt upp din miljö.

Felsök GPU och distribuerade arbetsbelastningar

Genie Code kan använda notebook-utdata och tillgängliga loggar för att undersöka distribuerade träningsfel, kommunikationsfel, träningshängningar och GPU-minnesproblem. Det kan hjälpa till att identifiera det ursprungliga felet och skilja det från följdfel på andra ranker. För information om att visa distribuerade träningsloggar, se Experimentspårning och observerbarhet.

Exempeluppmaningar

Utveckla distribuerade träningsarbetsbelastningar

  • "Uppdatera denna notebook för att köra distribuerad träning på alla åtta H100-GPU:er i AI Runtime."
  • "Gå igenom denna distribuerade träningsanteckningsbok och fixa dess användning av serverless_gpu och MLflow."
  • "Anpassa denna träningsbelastning för AI Runtime och förklara de viktiga förändringarna."

Lös miljö- och beroendeproblem

  • "Den här anteckningsboken slutade fungera efter att jag installerade ett nytt paket. Inspektera miljön och avgör om problemet är ett beroendeproblem eller en kod-API-ändring."
  • "Bör denna arbetsbelastning använda Databricks AI eller Standard-miljö? Granska dess beroenden och rekommendera en miljö innan du ändrar något."
  • "Diagnostisera detta paketkompatibilitetsfel och rekommendera den minsta lämpliga förändringen."

Felsök GPU och distribuerade arbetsbelastningar

  • "Analysera denna misslyckade distribuerade träningskörning med hjälp av tillgängliga utdata från varje rang och identifiera grundorsaken."
  • Varför hänger den distribuerade arbetsbelastningen? Använd anteckningsbokens utdata för att rekommendera nästa felsökningssteg."
  • "Undersök detta GPU-minnesfel och rekommendera ett evidensbaserat nästa steg."

Ytterligare resurser