Среда выполнения ИИ

Это важно

Эта функция доступна в общедоступной предварительной версии.

AI Runtime — это бессерверное GPU-вычислительное предложение в Databricks, предназначенное для рабочих нагрузок глубокого обучения . Среду выполнения ИИ можно использовать для обучения и точной настройки пользовательских моделей с помощью любимых платформ и получения эффективной эффективности, производительности и качества.

Начало работы

Выполните первую нагрузку за несколько минут, используя наши руководства по быстрому старту.

Начало работы Description
🚀 Краткое руководство по Databricks CLI Приходите из кластера Slurm или Kubernetes? Тренируйтесь на AI Runtime от терминала за считанные минуты.
📓 Быстрый запуск блокнота Подключите ноутбук к видеокарте за считанные секунды и развивайте его интерактивно.
⚡ Рэй Из кластера лучей? Запустите Ray на AI Runtime с поддержкой панелей управления.
🧭 Обзор За две минуты узнайте основные вещи о AI Runtime: доступные видеокарты, как это работает и ограничения.

Компоненты

AI Runtime — это полноценная GPU-платформа с множеством способов подключения к GPU, встроенными инструментами наблюдаемости и отладки, а также готовыми средами.

Подключайтесь к бессерверным графическим процессорам: получайте доступ к ним откуда бы вы ни работали.

Функция Description
Ноутбуки Подключите блокнот к бессерверным GPU-вычислениям и разрабатывайте интерактивно, без настройки кластера.
IDE через SSH Подключитесь из вашего IDE или терминала через SSH-тоннель, чтобы работать напрямую на узле GPU.
Databricks CLI Отправляйте и управляйте распределёнными заданиями по обучению GPU с вашего ноутбука с помощью конфигураций заданий YAML.
Луч Запускайте Ray Core, Ray Data, Ray Train и Ray Tune на бессерверных GPU-вычислительных ресурсах.

Управление зависимостями: Управляйте библиотеками Python и системы, с которыми выполняется ваша рабочая нагрузка.

Функция Description
Готовые среды Начните с минимальной среды Standard или AI-среды Databricks с предварительной загрузкой ML-фреймворков.

Загрузка данных в GPU: эффективно передавайте обучающие данные на ваши GPU.

Функция Description
Эффективные загрузчики данных Передавайте данные в потоковом режиме из томов Unity Catalog, используя отказоустойчивые загрузчики, обеспечивающие высокую загрузку GPU.

Отладка и наблюдаемость: отслеживайте эксперименты, проверяйте выходные данные и диагностируйте отказы.

Функция Description
MLflow для глубокого обучения Отслеживайте эксперименты, метрики и запуски с помощью MLflow.
Просмотр журналов Просматривайте учебные результаты и отслеживайте использование ресурсов GPU во время выполнения кода.
Отладка с помощью агентов Используйте код Genie для генерации учебного кода, решения проблем с окружением и отладки сбоев GPU.

Планирование и обслуживание в реальном времени: переходите от интерактивной разработки к запланированным заданиям и конечным точкам.

Функция Description
Создайте свои задачи Развертывайте обучающий код с помощью пакетов декларативной автоматизации, планируйте запуски и строите многозадачные рабочие процессы GPU и CPU.
Обслуживайте своих моделей Размещайте обученные модели за масштабируемой конечной точкой с помощью Model Serving.

Примеры

Клонируйте готовые комплексные примеры и запускайте их в AI Runtime за считанные минуты — через CLI или в ноутбуках.

Пример Description
Классическое машинное обучение ускоренный на GPU XGBoost, zero-shot-прогнозирование для табличных данных и прогнозирование временных рядов.
Системы рекомендаций Обучайте модели рекомендаций для глубокого обучения, такие как архитектуры с двумя башнями.
Компьютерное зрение Задачи по обнаружению объектов и классификации изображений на GPU.
Модели OSS после обучения (LLM) Дорабатывайте и обучайте открытые LLM с помощью LoRA, полной настройки и библиотек вроде TRL, Unsloth и Axolotl.
Пакетный вывод Запускайте крупномасштабный пакетный вывод с помощью Ray Data и vLLM на нескольких GPU.
Распределенное обучение с несколькими GPU Масштабировать обучение на нескольких GPU и узлах с помощью DDP, FSDP и DeepSpeed.

Guides

Практические руководства по переносу рабочих нагрузок на AI Runtime и максимально эффективному использованию ваших GPU.

Guide Description
Переход со Slurm Сопоставьте ваши пакетные скрипты Slurm, средства запуска распределённых задач и общее хранилище данных с Databricks CLI.
Миграция классических рабочих нагрузок GPU Перенести существующую нагрузку на глубокое обучение из классического кластера Databricks в AI Runtime.
Производительность и устойчивость Повысить пропускную способность обучения и сделать долгосрочные работы более устойчивыми к неудачам.

Узнать больше

Найдите полезный контент: последние обновления продуктов и то, как работает AI Runtime.

Resource Description
Обновления продуктов Смотрите последние обновления и анонсы продуктов AI Runtime.
Как работает AI Runtime под капотом Узнайте, как Databricks обеспечивает надёжность видеокарт на всех этапах выполнения искусственного интеллекта.