Usa il codice Genie con runtime AI

Importante

Questa funzionalità è in Anteprima Pubblica.

Genie Code ti aiuta a sviluppare e risolvere i problemi di carichi di lavoro di deep learning in notebook collegati a AI Runtime. Può generare codice di addestramento distribuito, risolvere problemi di ambiente e dipendenze, e indagare sui fallimenti del carico di lavoro della GPU.

Genie Code crea ed esegue un carico di lavoro di addestramento CNN distribuito su otto GPU H100 in un notebook AI Runtime.

Requisiti

Per usare Genie Code con AI Runtime:

Get started

  1. Apri un notebook di Azure Databricks.

  2. Collega il notebook all'AI Runtime. Vedere Connettersi ad AI Runtime.

  3. Apri il pannello del Codice Genio.

  4. Descrivi il carico di lavoro che vuoi sviluppare o il problema che vuoi risolvere.

  5. Rivedi il piano proposto, le modifiche al codice e le azioni prima di approvarli.

    Importante

    Il Codice Genio può commettere errori. Rivedi il codice generato, i cambiamenti ambientali e le altre azioni proposte prima di eseguirli. Alcune diagnosi richiedono log aggiuntivi o contesto del carico di lavoro.

Che cosa può aiutare Genie Code?

Sviluppare carichi di lavoro di addestramento distribuiti

Genie Code può generare o aggiornare codice di addestramento per AI Runtime. Può aiutarti a selezionare una strategia distribuita PyTorch appropriata, utilizzare l'API @distributed del serverless_gpu pacchetto e applicare i pattern di runtime AI per il caricamento dati, checkpoint e tracciamento MLflow. Per dettagli e esempi sull'API, vedi Addestramento distribuito nei notebook.

Risolvere problemi di ambiente e dipendenze

Genie Code può ispezionare l'ambiente attuale, distinguere i fallimenti di compatibilità del pacchetto dalle modifiche al codice o all'API e raccomandare correzioni mirate. Può anche aiutarti a scegliere tra l'AI Databricks e gli ambienti Standard in base alle dipendenze del carico di lavoro. Per informazioni sugli ambienti disponibili, vedi Configura il tuo ambiente.

Debug GPU e carichi di lavoro distribuiti

Genie Code può utilizzare l'output del notebook e i log disponibili per indagare fallimenti di addestramento distribuito, errori di comunicazione, blocchi di addestramento e problemi di memoria GPU. Può aiutare a identificare il guasto originale e distinguerlo dagli errori a valle di altri gradi. Per informazioni sulla visualizzazione dei log di addestramento distribuiti, vedi Tracciamento e osservabilità degli esperimenti.

Esempi di suggerimenti

Sviluppare carichi di lavoro di addestramento distribuiti

  • "Aggiorna questo notebook per eseguire l'addestramento distribuito su tutte e otto le GPU H100 in AI Runtime."
  • Rivedi questo notebook di addestramento distribuito e correggine l'uso di serverless_gpu e MLflow.
  • Adatta questo carico di lavoro di addestramento per AI Runtime e spiega le modifiche principali.

Risolvere problemi di ambiente e dipendenze

  • "Questo quaderno ha smesso di funzionare dopo che ho installato un nuovo pacchetto. Ispezionare l'ambiente e determinare se il problema sia una questione di dipendenza o un cambiamento dell'API di codice."
  • "Questo carico di lavoro dovrebbe usare l'AI Databricks o l'ambiente Standard? Rivedi le sue dipendenze e raccomanda un ambiente prima di cambiare qualcosa."
  • "Diagnostica questo errore di compatibilità del pacchetto e raccomanda la modifica più piccola e appropriata."

Debug GPU e carichi di lavoro distribuiti

  • "Analizza questa esecuzione di addestramento distribuito fallita utilizzando l'output disponibile di ogni grado e identifica la causa principale."
  • "Perché questo carico di lavoro distribuito è sospeso? Usa l'output del notebook per raccomandare il prossimo passaggio di debug."
  • "Indagate su questo guasto alla memoria GPU e raccomandate un prossimo passo basato sulle evidenze."

Risorse aggiuntive