Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Cette fonctionnalité est disponible en préversion publique.
Genie Code vous aide à développer et à résoudre les problèmes liés à des charges de travail en apprentissage profond dans des notebooks connectés à AI Runtime. Il peut générer du code d’entraînement distribué, résoudre des problèmes d’environnement et de dépendances, et enquêter sur les défaillances de charge GPU.
Spécifications
Pour utiliser Genie Code avec l’environnement d’exécution IA :
- Répondre aux exigences relatives aux capacités agentiques de Genie Code.
- Disposer d’un accès à AI Runtime dans une région qui prend en charge les deux produits. Voir les exigences d’exécution de l’IA et la disponibilité géographique du code Genie.
- Connectez un ordinateur portable à l’exécution IA en utilisant le calcul GPU sans serveur. Voir Se connecter à l’environnement d’exécution de l’IA.
Get started
Ouvre un notebook Azure Databricks.
Connectez le notebook à AI Runtime. Voir Connexion au runtime d’IA.
Ouvre le panneau Code Génie.
Décrivez la charge de travail que vous souhaitez développer ou le problème que vous souhaitez résoudre.
Examinez le plan proposé, les modifications du code et les actions avant de les approuver.
Important
Le code génie peut faire des erreurs. Examinez le code généré, les modifications de l’environnement et les autres actions proposées avant de les exécuter. Certains diagnostics nécessitent des journaux supplémentaires ou un contexte de charge de travail.
Qu’est-ce que Genie Code peut aider ?
Développer des charges de travail de formation distribuées
Genie Code peut générer ou mettre à jour le code d’entraînement pour l’exécution IA. Il peut vous aider à sélectionner une stratégie de distribution PyTorch adaptée, à utiliser l’API @distributed du package serverless_gpu et à appliquer des modèles AI Runtime pour le chargement des données, la gestion des points de contrôle et le suivi avec MLflow. Pour les détails et exemples d’API, voir Entraînement distribué dans les carnets.
Résoudre les problèmes d’environnement et de dépendance
Genie Code peut inspecter l’environnement actuel, distinguer les échecs de compatibilité des packages des modifications de code ou d’API, et recommander des correctifs ciblés. Il peut également vous aider à choisir entre les environnements Databricks AI et Standard en fonction des dépendances de votre charge de travail. Pour des informations sur les environnements disponibles, voir Configurez votre environnement.
Débogage des charges de travail GPU et distribuées
Genie Code peut utiliser les résultats du notebook et les journaux disponibles pour analyser les échecs de l’entraînement distribué, les erreurs de communication, les blocages de l’entraînement et les problèmes de mémoire du GPU. Cela peut aider à identifier la défaillance initiale et à la distinguer des erreurs en aval sur d’autres rangs. Pour des informations sur la visualisation des journaux d’entraînement distribués, voir Suivi et observabilité de l’expérience.
Exemples d’invites
Développer des charges de travail de formation distribuées
- Mettez à jour ce notebook pour effectuer un entraînement distribué sur les huit GPU H100 dans AI Runtime.
- Examinez ce notebook d’entraînement distribué et corrigez son utilisation de
serverless_gpuet de MLflow. - « Adaptez cette charge d’entraînement au temps d’exécution de l’IA et expliquez les changements importants. »
Résoudre les problèmes d’environnement et de dépendance
- « Ce carnet a cessé de fonctionner après que j’ai installé un nouveau paquet. Inspectez l’environnement et déterminez si le problème est un problème de dépendance ou un changement d’API de code. »
- « Cette charge de travail doit-elle utiliser l’IA Databricks ou l’environnement Standard ? Examinez ses dépendances et recommandez un environnement avant de changer quoi que ce soit. »
- « Diagnostiquer cette erreur de compatibilité et recommander le plus petit changement approprié. »
Déboguer les charges de travail GPU et distribuées
- « Analysez cette épreuve d’entraînement distribuée ratée en utilisant les résultats disponibles de chaque rang et identifiez la cause profonde. »
- « Pourquoi cette charge de travail répartie est-elle suspendue ? Utilisez la sortie du notebook pour recommander la prochaine étape de débogage. »
- « Enquêtez sur cette défaillance mémoire du GPU et recommandez une prochaine étape fondée sur des preuves. »