Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Important
Эта функция доступна в общедоступной предварительной версии.
Среда выполнения ИИ — это предложение вычислений в Databricks, предназначенное для рабочих нагрузок глубокого обучения , и обеспечивает поддержку GPU для Databricks Serverless. Среду выполнения ИИ можно использовать для обучения и точной настройки пользовательских моделей с помощью любимых платформ и получения эффективной эффективности, производительности и качества. Общие сведения о том, как бессерверные вычисления соответствуют архитектуре Databricks, см. в разделе "Бессерверная архитектура рабочей области".
Ключевые особенности
AI Runtime сочетает управляемую инфраструктуру GPU с средой выполнения, созданной для глубокого обучения:
- Полностью управляемая инфраструктура GPU: бессерверный, гибкий доступ к gpu и без конфигурации кластера, выбора драйверов или политик автомасштабирования для управления.
- Среда выполнения, выделенная для глубокого обучения: выберите минимальную стандартную среду для максимальной гибкости по сравнению с зависимостями или полнофункциональное окружение ИИ, предварительно загруженное с помощью популярных платформ машинного обучения.
- Встроенная интеграция между записными книжками, заданиями, каталогом Unity и MLflow для простой разработки, доступа к данным и отслеживания экспериментов.
Аппаратные опции
Все акселераторы среды выполнения ИИ подготавливают один узел. Количество gpu на этом узле зависит от типа акселератора:
| Accelerator | Графические процессоры на узел | Память GPU | лучше всего подходит для | Распределенное обучение |
|---|---|---|---|---|
| 1xA10 | 1 | 24 ГБ | Небольшие и средние задачи машинного обучения и глубокого обучения, такие как классические модели машинного обучения или более мелкие языковые модели | Не поддерживается (один GPU) |
| 1xH100 | 1 | 80 ГБ | Рабочие нагрузки, которым требуется больше видеопамяти, чем обеспечивает одна A10, но не нужно распределенное обучение на нескольких GPU, например дообучение языковых моделей среднего размера | Не поддерживается (один GPU) |
| 8xH100 | 8 | 80 ГБ на GPU | Крупномасштабные рабочие нагрузки искусственного интеллекта, включая обучение или уточнение массовых моделей или выполнение сложных задач глубокого обучения | Поддерживается с использованием декоратора @distributed с gpus=8 |
Подсказка
Только 8xH100 поддерживает распределённое обучение на нескольких GPU. Для одной видеокарты выберите 1xA10 или 1xH100 в зависимости от нужной вашей модели памяти GPU.
Рекомендуемые варианты использования
Databricks рекомендует среду выполнения ИИ для любых вариантов использования пользовательской модели, включающих глубокое обучение, крупномасштабные классические рабочие нагрузки или графические процессоры.
Рассмотрим пример.
- Точная настройка LLM (LoRA, QLoRA, полная настройка)
- Компьютерное зрение (обнаружение объектов, классификация изображений)
- Системы рекомендаций на основе глубокого обучения
- Обучение с подкреплением
- Прогнозирование временных рядов на основе глубокого обучения
Требования
Перед началом убедитесь, что ваше рабочее пространство соответствует следующим требованиям:
- Рабочая область в одном из следующих регионов, поддерживаемых Azure:
centraluseastuseastus2northcentraluswestcentraluswestuswestus3
- Предпросмотр AI Runtime должен быть активирован через настройки администратора рабочего пространства. См. Управление предварительными версиями Databricks.
Limitations
Имейте в виду следующие ограничения при планировании работы по AI Runtime:
- Среда выполнения ИИ поддерживает только акселераторы A10 и H100.
- Среда выполнения ИИ не поддерживает профиль безопасности соответствия стандартам FedRAMP High или DoD IL5.
- Добавление зависимостей с помощью панели "Среды " не поддерживается для запланированных заданий среды выполнения ИИ. Установите зависимости программным способом с помощью
%pip installв вашем ноутбуке вместо этого. - Для запланированных заданий в среде выполнения ИИ автоматическое восстановление несовместимых версий пакетов, связанных с записной книжкой, не поддерживается.
- Попытки подключения к AI Runtime прекращаются через 15 минут для интерактивных блокнотов и через 24 часа для заданий блокнота или заданий CLI. Связанные сессии в ноутбуке и задания могут длиться до двух дней, а задачи CLI — до 14 дней. Для долгосрочных задач обучения модели реализуйте контрольные точки и перезапускайте задание при достижении максимального времени выполнения.
- Среда выполнения ИИ предоставляет доступ по запросу к ресурсам GPU. Хотя это приводит к простому гибкому доступу к графическим процессорам, могут возникнуть периоды, когда емкость ограничена или недоступна в вашем регионе.
- Среда выполнения ИИ использует межрегиональные графические процессоры в некоторых случаях в периоды высокого спроса. При таком использовании может взиматься плата за исходящий трафик, а сетевое соединение между регионами в отдельные периоды может быть ограничено.
Подключение к среде выполнения ИИ
Вы можете подключаться к среде выполнения ИИ в интерактивном режиме из записных книжек, терминала интегрированной среды разработки с помощью туннеля SSH, запланированных заданий, API заданий и декларативного пакета автоматизации. Для пошаговых инструкций смотрите в разделе «Подключиться к AI Runtime из блокнота».
Настройка среды
AI Runtime предлагает две управляемые среды Python: минимальную среду Standard и полнофункциональную среду Databricks AI, в которую уже включены популярные фреймворки машинного обучения, такие как PyTorch и Transformers. Дополнительные сведения о выборе среды, кэшировании, импорте пользовательских модулей и известных ограничениях см. в статье "Настройка среды".
Подсказка
Выберите среду Standard для полного контроля над стеком зависимостей, или AI-среду Databricks , чтобы не устанавливать распространённые фреймворки, такие как PyTorch и Transformers.
Загрузка данных в среде выполнения ИИ
Понимание того, как доступ к данным работает в среде выполнения ИИ, является важным для плавного взаимодействия. Дополнительные сведения см. в разделе "Загрузка данных в среде выполнения ИИ".
Распределенное обучение
Среда выполнения ИИ поддерживает распределенное обучение по нескольким GPU на одном узле, к которому подключена записная книжка. Используя декоратор @distributed из API Python serverless_gpu, можно запускать задачи на нескольких GPU с помощью PyTorch DDP, FSDP или DeepSpeed с минимальной настройкой. Дополнительные сведения см. в разделе "Распределенное обучение" в записных книжках.
Подсказка
Проверьте вашу рабочую нагрузку на одном GPU, прежде чем масштабировать её до 8xH100 с помощью декоратора @distributed.
Рэй на AI Runtime
AI Runtime поддерживает Ray для распределённых рабочих нагрузок GPU, включая Ray Core, Ray Data, Ray Train и Ray Tune. Вы можете запускать одноузловые и многоузловые Ray-задачи на серверных GPU-вычислениях без настройки кластера. Для подробностей и примеров см. Ray on AI Runtime.
Отслеживание экспериментов и наблюдаемость
Для интеграции MLflow, просмотра журналов и мониторинга GPU см. Отслеживание экспериментов и наблюдаемость. О контрольных точках модели см. Повышение производительности и отказоустойчивости обучения в AI Runtime.
Подготовка обучающих нагрузок к промышленной эксплуатации
Разверните среду выполнения ИИ с помощью декларативных пакетов автоматизации, чтобы запускать собственный код для обучения, создавать составные задачи, объединяющие GPU- и CPU-задачи, планировать пайплайны и переводить решения из разработки в продакшен. См. Производственные обучающие нагрузки.
Код Genie для глубокого обучения
Genie Code помогает разрабатывать рабочие нагрузки глубокого обучения и устранять неполадки в среде AI Runtime. Он может генерировать распределённый обучающий код, решать проблемы с окружением и зависимостями, а также исследовать сбои GPU и распределённых рабочих нагрузок. См. «Использование кода Genie со средой выполнения ИИ».
Guides
Для информации о миграции классических рабочих нагрузок, примерах записных книжек и устранении неполадок см. руководства пользователей для среды выполнения ИИ. Чтобы перенести существующую обучающую рабочую нагрузку Slurm в AI Runtime, см. Переход со Slurm.