Используйте код Genie с AI Runtime

Important

Эта функция доступна в общедоступной предварительной версии.

Genie Code помогает разрабатывать и устранять задачи глубокого обучения в ноутбуках, подключённых к AI Runtime. Он может генерировать распределённый обучающий код, решать вопросы среды и зависимостей, а также исследовать сбои с нагрузкой GPU.

Genie Code создаёт и запускает распределённую нагрузку для обучения CNN на восьми графических процессорах H100 в блокноте AI Runtime.

Requirements

Чтобы использовать код Genie с AI Runtime:

Get started

  1. Откройте блокнот Azure Databricks.

  2. Подключите ноутбук к AI Runtime. См. Подключение к среде выполнения ИИ.

  3. Откройте панель Genie Code.

  4. Опишите объём работы, которую вы хотите разработать, или проблему, которую хотите решить.

  5. Ознакомьтесь с предлагаемым планом, изменениями в кодексе и действиями перед их утверждением.

    Important

    Код Джина может ошибаться. Просматривайте сгенерированный код, изменения среды и другие предлагаемые действия перед их запуском. Некоторые диагнозы требуют дополнительных логов или контекста рабочей нагрузки.

С чем может помочь Genie Code?

Разработка распределённых нагрузок для обучения

Genie Code может генерировать или обновлять обучающий код для AI Runtime. Он поможет выбрать подходящую распределённую стратегию PyTorch, использовать @distributed API из пакета serverless_gpu и применить AI Runtime паттерны для загрузки данных, контрольных точок и отслеживания MLflow. Для подробностей API и примеров см. раздел Распределённое обучение в ноутбуках.

Решайте вопросы среды и зависимостей

Genie Code может инспектировать текущую среду, отличать сбои совместимости пакетов от изменений кода или API и рекомендовать целевые исправления. Он также может помочь вам выбрать между средами Databricks AI и Standard исходя из зависимостей вашей рабочей нагрузки. Для информации о доступных окружениях см. раздел «Настройте вашу среду».

Отладка GPU и распределённые рабочие нагрузки

Genie Code может использовать выходные данные с блокнота и доступные логи для расследования распределённых сбоев в обучении, ошибок коммуникации, зависаний в обучении и проблем с памятью GPU. Это помогает выявить исходную неисправность и отличить её от ошибок, возникающих на других рангах. Для получения информации о просмотре распределённых обучающих журналов см. раздел «Отслеживание экспериментов и наблюдаемость».

Примеры подсказок

Разработка распределённых нагрузок для обучения

  • «Обнови этот блокнот для распределённого обучения на всех восьми графических процессорах H100 в AI Runtime.»
  • «Проверьте этот распределённый учебный блокнот и исправьте его использование serverless_gpu и MLflow.»
  • «Адаптируйте эту учебную нагрузку для AI Runtime и объясните важные изменения.»

Решайте вопросы среды и зависимостей

  • «Этот блокнот перестал работать после того, как я установил новый пакет. Проверьте окружение и определите, связана ли проблема с зависимостями или изменением в API кода.»
  • Следует ли этой рабочей нагрузке использовать среду Databricks AI или стандартную среду? Изучите его зависимости и порекомендуйте окружающую среду, прежде чем что-либо менять.»
  • «Диагностируйте эту ошибку совместимости пакетов и рекомендуйте минимальное подходящее изменение.»

Отладка GPU и распределённые рабочие нагрузки

  • «Проанализируйте этот неудачный распределённый обучающий запуск, используя доступные данные каждого ранга, и определите корень причины.»
  • «Почему эта распределённая нагрузка зависает? Используйте вывод из блокнота, чтобы порекомендовать следующий шаг отладки.»
  • «Расследуйте этот сбой памяти GPU и порекомендуйте следующий шаг, основанный на доказательствах.»

Дополнительные ресурсы