Среда выполнения ИИ

Это важно

Эта функция доступна в общедоступной предварительной версии.

Среда выполнения ИИ — это предложение вычислений в Databricks, предназначенное для рабочих нагрузок глубокого обучения , и обеспечивает поддержку GPU для Databricks Serverless. Среду выполнения ИИ можно использовать для обучения и точной настройки пользовательских моделей с помощью любимых платформ и получения эффективной эффективности, производительности и качества. Общие сведения о том, как бессерверные вычисления соответствуют архитектуре Databricks, см. в разделе "Бессерверная архитектура рабочей области".

Ключевые особенности

  • Полностью управляемая инфраструктура GPU: бессерверный, гибкий доступ к gpu и без конфигурации кластера, выбора драйверов или политик автомасштабирования для управления.
  • Среда выполнения, выделенная для глубокого обучения: выберите минимальную стандартную среду для максимальной гибкости по сравнению с зависимостями или полнофункциональное окружение ИИ, предварительно загруженное с помощью популярных платформ машинного обучения.
  • Встроенная интеграция между записными книжками, заданиями, каталогом Unity и MLflow для простой разработки, доступа к данным и отслеживания экспериментов.
  • Поддержка соответствия требованиям: поддерживает большинство стандартов соответствия. Сведения о поддерживаемых стандартах и исключениях см. в профиле безопасности соответствия требованиям.
  • Доступ к веб-терминалу: запускайте команды оболочки, отслеживайте использование GPU с помощью nvidia-smi, а также управляйте файлами непосредственно в вычислительной среде при подключении к бессерверной среде GPU версии 5 и выше. См. Выполнение команд оболочки в веб-терминале Azure Databricks.

Параметры оборудования

Все акселераторы среды выполнения ИИ подготавливают один узел. Количество gpu на этом узле зависит от типа акселератора:

Ускоритель Графические процессоры на узел Память GPU лучше всего подходит для Распределенное обучение
1xA10 1 24 ГБ Небольшие и средние задачи машинного обучения и глубокого обучения, такие как классические модели машинного обучения или более мелкие языковые модели Не поддерживается (один GPU)
1xH100 1 80 ГБ Рабочие нагрузки, которым требуется больше видеопамяти, чем обеспечивает одна A10, но не нужно распределенное обучение на нескольких GPU, например дообучение языковых моделей среднего размера Не поддерживается (один GPU)
8xH100 8 80 ГБ на GPU Крупномасштабные рабочие нагрузки искусственного интеллекта, включая обучение или уточнение массовых моделей или выполнение сложных задач глубокого обучения Поддерживается с использованием декоратора @distributed с gpus=8

Databricks рекомендует среду выполнения ИИ для любых вариантов использования пользовательской модели, включающих глубокое обучение, крупномасштабные классические рабочие нагрузки или графические процессоры.

Рассмотрим пример.

  • Точная настройка LLM (LoRA, QLoRA, полная настройка)
  • Компьютерное зрение (обнаружение объектов, классификация изображений)
  • Системы рекомендаций на основе глубокого обучения
  • Обучение с подкреплением
  • Прогнозирование временных рядов на основе глубокого обучения

Требования

  • Рабочая область в одном из следующих регионов, поддерживаемых Azure:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3

Ограничения

  • Среда выполнения ИИ поддерживает только акселераторы A10 и H100.
  • Среда выполнения ИИ не поддерживает профиль безопасности соответствия стандартам FedRAMP High или DoD IL5. Поддерживаются все остальные стандарты соответствия.
  • Добавление зависимостей с помощью панели "Среды " не поддерживается для запланированных заданий среды выполнения ИИ. Установите зависимости программным способом с помощью %pip install в вашем ноутбуке вместо этого.
  • Для запланированных заданий в среде выполнения ИИ автоматическое восстановление несовместимых версий пакетов, связанных с записной книжкой, не поддерживается.
  • Попытки подключения к AI Runtime прекращаются через 15 минут для интерактивных блокнотов и через 24 часа для заданий блокнота или заданий CLI. Связанные сессии в блокноте и задания могут длиться до семи дней, а задачи CLI — до 14 дней. Для долгосрочных задач обучения модели реализуйте контрольную точку и перезапускайте задачу после достижения максимального времени выполнения.
  • Среда выполнения ИИ предоставляет доступ по запросу к ресурсам GPU. Хотя это приводит к простому гибкому доступу к графическим процессорам, могут возникнуть периоды, когда емкость ограничена или недоступна в вашем регионе.
  • Среда выполнения ИИ использует межрегиональные графические процессоры в некоторых случаях в периоды высокого спроса. При таком использовании может взиматься плата за исходящий трафик, а сетевое соединение между регионами в отдельные периоды может быть ограничено.

Подключение к среде выполнения ИИ

Вы можете подключаться к среде выполнения ИИ в интерактивном режиме из записных книжек, терминала интегрированной среды разработки с помощью туннеля SSH, запланированных заданий, API заданий и декларативного пакета автоматизации. Пошаговые инструкции см. в разделе "Подключение к среде выполнения ИИ".

Настройка среды

AI Runtime предлагает две управляемые среды Python: минимальную среду Standard и полнофункциональную среду Databricks AI, в которую уже включены популярные фреймворки машинного обучения, такие как PyTorch и Transformers. Дополнительные сведения о выборе среды, кэшировании, импорте пользовательских модулей и известных ограничениях см. в статье "Настройка среды".

Загрузка данных в среде выполнения ИИ

Понимание того, как доступ к данным работает в среде выполнения ИИ, является важным для плавного взаимодействия. Дополнительные сведения см. в разделе "Загрузка данных в среде выполнения ИИ".

Распределенное обучение

Среда выполнения ИИ поддерживает распределенное обучение по нескольким GPU на одном узле, к которому подключена записная книжка. Используя декоратор @distributed из API Python serverless_gpu, можно запускать задачи на нескольких GPU с помощью PyTorch DDP, FSDP или DeepSpeed с минимальной настройкой. Дополнительные сведения см. в разделе "Распределенное обучение" в записных книжках.

Рэй на AI Runtime

AI Runtime поддерживает Ray для распределённых рабочих нагрузок GPU, включая Ray Core, Ray Data, Ray Train и Ray Tune. Вы можете запускать одноузловые и многоузловые Ray-задачи на серверных GPU-вычислениях без настройки кластера. Для подробностей и примеров см. Ray on AI Runtime.

Отслеживание экспериментов и наблюдаемость

Сведения об интеграции MLflow, просмотре журналов и управлении контрольными точками модели см. в разделе "Отслеживание экспериментов" и "Наблюдаемость".

Ввести задачи обучения в промышленную эксплуатацию

Разверните среду выполнения ИИ с помощью декларативных пакетов автоматизации, чтобы запускать собственный код для обучения, создавать составные задачи, объединяющие GPU- и CPU-задачи, планировать пайплайны и переводить решения из разработки в продакшен. См. Производственные обучающие нагрузки.

Код Genie для глубокого обучения

Genie Code помогает разрабатывать рабочие нагрузки глубокого обучения и устранять неполадки в среде AI Runtime. Он может генерировать распределённый обучающий код, решать проблемы с окружением и зависимостями, а также исследовать сбои GPU и распределённых рабочих нагрузок. См. «Использование кода Genie со средой выполнения ИИ».

Guides

Для информации о миграции классических рабочих нагрузок, примерах записных книжек и устранении неполадок см. руководства пользователей для среды выполнения ИИ.