Azure Databricks возможности обработки и анализа данных и машинного обучения

Azure Databricks имеет единую платформу для полного жизненного цикла обработки и анализа данных (DS) и машинного обучения (ML), от приема необработанных данных с помощью проектирования функций, обучения моделей, развертывания и мониторинга рабочей среды. Azure Databricks интегрируется с популярными фреймворками машинного обучения с открытым исходным кодом, добавляя средства корпоративного управления, наблюдаемости и операционные инструменты, в совокупности называемые MLOps.

На этой странице перечислены основные возможности DS и МАШИНного обучения, упорядоченные по этапу рабочего процесса.

Разведочный анализ данных

Azure Databricks упрощает анализ аналитических данных (EDA), предоставляя интерактивные, совместные и вспомогательные средства искусственного интеллекта для специалистов по обработке и анализу данных. Специалисты по обработке и анализу данных могут изучить данные с помощью чата естественного языка, пользовательского интерфейса или кода, и они могут совместно работать с помощью совместного редактирования и совместного использования кода на основе Git. Genie Code может выполнять полностью автоматизированную EDA или выступать в качестве интерактивного помощника.

Category Features
Пользовательский интерфейс
Collaboration
Помощники по искусственному интеллекту

Подготовка и обслуживание функций

Azure Databricks упрощает использование данных для машинного обучения путем объединения управления данными и рабочими нагрузками машинного обучения. Поскольку все данные управляются в Unity Catalog с детально настроенными правами доступа, вы можете настроить границы между задачами обработки данных и машинного обучения в соответствии со структурой вашей организации. Данные можно подготовить для машинного обучения с помощью любых средств проектирования данных , таких как конвейеры Lakeflow. Функции управляются в Хранилище компонентов как для пакетной службы, так и в режиме реального времени с одним управляемым источником истины для функций.

Genie Code ускоряет обнаружение и подготовку данных, просматривая каталог Unity, чтобы обнаружить соответствующие таблицы, предложить преобразования функций и создать код для приема и конвейеров функций.

Тип компонента Features
Пакетные функции
  • Таблицы компонентов в хранилище каталогов Unity предварительно компилируют пакетные функции с автоматической подготовкой и управлением. Команды находят и повторно используют существующие возможности, а не создают пайплайны с нуля.
  • Представления функций предоставляют новый API для определения функций, которые затем можно использовать для пакетного или реального времени вычислений функций.
Функции реального времени
  • Для предварительно компьютированных функций интернет-магазины функций служат таблицами функций для вариантов использования модели в режиме реального времени.
  • Если входные данные для вычисления признаков доступны только при обслуживании запросов, сервис выдачи признаков поддерживает вычисление признаков по запросу в дополнение к таблицам признаков. Признаки задаются в виде функций, а не вычисляются заранее.
  • Представления функций предоставляют новый API для определения функций, которые затем можно использовать для пакетного или реального времени вычислений функций.
Неструктурированные данные Поиск ИИ позволяет обслуживать неструктурированные данные и выполнять семантический поиск.

Обучайте модели машинного обучения

Azure Databricks имеет гибкие инструменты для обучения моделей машинного обучения и глубокого обучения. Преднастроенные и настраиваемые среды позволяют использовать пользовательские библиотеки машинного обучения, а бессерверные вычислительные ресурсы с CPU и GPU-ускорением — вертикально и горизонтально масштабироваться по требованию. Genie Code предоставляет интеллектуальные возможности AutoML, обрабатывая запросы на естественном языке и создавая полноценные рабочие процессы из нескольких ноутбуков для выделения признаков, обучения, настройки, оценки и развертывания.

Category Features
Типы машинного обучения Azure Databricks поддерживает все типы машинного обучения, включая:
  • Классическое машинное обучение: защищенное и неконтролируемое обучение с помощью scikit-learn, XGBoost, LightGBM, Apache Spark MLlib и других платформ машинного обучения
  • Глубокое обучение: обучение нейронных сетей с использованием PyTorch, TensorFlow и Hugging Face Transformers, включая распределённое обучение на нескольких GPU
  • Настройка гиперпараметра: автоматизированный поиск по алгоритму и пространствам гиперпараметра с помощью таких средств, как Optuna и Ray

Сведения об ИИ см. в разделе Возможности ИИ в Azure Databricks.
Вычисления
  • Бессерверные вычисления запускаются мгновенно для интерактивных записных книжек и запланированных рабочих процессов с автоматическим масштабированием и без управления кластерами. Он поддерживает как кластеры на базе CPU, так и кластеры с ускорением на GPU.
  • Классические вычислительные ресурсы имеют управление одним компьютером и кластером для рабочих нагрузок ЦП и GPU.
Среды и библиотеки
  • Бессерверные вычислительные среды предоставляют базовые среды, которые можно полностью настроить для машинного обучения. Для бессерверных вычислений GPU среда выполнения ИИ предоставляет предварительно настроенные среды для обучения и вывода на основе GPU.
  • Для классических вычислительных сред Databricks Runtime for Машинное обучение предоставляет предварительно настроенные среды кластеров с предустановленными и протестированными между собой основными библиотеками машинного обучения как для кластеров на базе CPU, так и для кластеров с ускорением GPU.
ИИ-ассистенты для программирования

Отслеживание экспериментов и управление ими

MLflow, управляемый Azure Databricks, служит основой для воспроизводимой и поддающейся аудиту разработки моделей машинного обучения. Интеграция с каталогом Unity и Git обеспечивает отслеживание и происхождение данных и ресурсов кода. Каждая версия модели в реестре содержит ссылку на запуск обучения, набор данных, среду и коммит Git, которые привели к ее созданию, обеспечивая полную историю аудита для любой развернутой модели.

Category Features
Отслеживание экспериментов Отслеживание MLflow регистрирует параметры, метрики и артефакты для каждого запуска обучения. Сравните запуски в пользовательском интерфейсе MLflow, чтобы определить оптимальную конфигурацию.
Реестр моделей Модели в каталоге Unity предоставляют реестр моделей MLflow, интегрированный с каталогом Unity. Версионированные артефакты модели управляются с помощью алиасов жизненного цикла (Staging, Production), контроля доступа, отслеживания происхождения и совместного доступа между рабочими областями.
Воспроизводимость Записные книжки и код можно версионировать с помощью папок Git Databricks и интегрировать с любым провайдером Git.

Развертывание и обслуживание моделей

Azure Databricks поддерживает как пакетный вывод, так и обслуживание запросов в реальном времени. Пакетный инференс позволяет эффективно применять модели на больших наборах данных, тогда как сервинг в реальном времени предоставляет доступ к моделям через API-эндпоинты с низкой задержкой. Genie Code может создавать код для развертывания модели и диагностировать проблемы и производительность для конечных точек обслуживания моделей.

Схема обслуживания Features
Пакетное прогнозирование
Обслуживание в режиме реального времени Model Serving предоставляет управляемые конечные точки REST с низкой задержкой, высокой доступностью и бессерверным автомасштабированием. Это поддерживает обслуживание ЦП и GPU для любой платформы машинного обучения, и вы можете использовать Genie для оценки и устранения неполадок конечных точек обслуживания.
Вывод на основе SQL
  • Функции ИИ предоставляют прогнозы машинного обучения с доступом к SQL для прогнозирования, обнаружения аномалий и анализа драйверов без Python или развертывания модели.
  • Для пользовательских моделей функция ИИ ai_query обеспечивает эффективный пакетный вывод с поддержкой эндпоинтов Model Serving.

Оценка и мониторинг

Azure Databricks предоставляет гибкие возможности оценки при обучении и непрерывного мониторинга в производственной среде. Журналы обслуживания в реальном времени записываются в таблицы инференса, управляемые в Unity Catalog, а мониторинг качества данных включает пользовательские метрики, панели мониторинга и оповещения.

Category Features
Evaluation
  • Оценка моделей в MLflow может использоваться для определения метрик, регистрируемых в MLflow, или отслеживание в MLflow может регистрировать метрики, вычисленные с помощью вашего пользовательского фреймворка.
  • Genie Code может помочь в выборе метрик оценки и написании кода оценки.
Ведение журнала прогнозирования Таблицы инференса регистрируют запросы и ответы при обслуживании, что позволяет выполнять мониторинг, аналитику и формировать обучающие наборы данных.
Мониторинг и оповещения

MLOps и управление

Azure Databricks предоставляет полный набор средств для операций машинного обучения (MLOps) и управления. MLOps Stacks предоставляет шаблоны для автоматизированного, повторяемого перевода из среды разработки в промышленную среду с помощью подхода «инфраструктура как код». Данные, функции, модели и конечные точки полностью управляются каталогом Unity и шлюзом искусственного интеллекта.

Category Features
CI/CD для машинного обучения Стеки MLOps, созданные на основе декларативных пакетов автоматизации, обеспечивают управление на основе кода и развертывание инфраструктуры машинного обучения и рабочих процессов. Сюда входят шаблоны CI/CD для автоматизации обучения, оценки и развертывания.
Оркестрация рабочего процесса Lakeflow Jobs координирует многоэтапные рабочие процессы машинного обучения в виде конвейеров, запускаемых по расписанию или по событию.
Управление ресурсами данных и моделей Каталог Unity предоставляет унифицированное управление данными, функциями и зарегистрированными моделями. Точные элементы управления доступом, отслеживание происхождения и журналы аудита применяются ко всем ресурсам.
Управление конечной точкой модели Шлюз ИИ обеспечивает централизованное управление и мониторинг конечных точек модели, включая ограничения скорости, отслеживание использования и ведение журнала полезных данных.

Поддержка с открытым исходным кодом

Azure Databricks обеспечивает полную поддержку экосистемы машинного обучения с открытым кодом.

Вы можете использовать любую платформу машинного обучения с открытым кодом на Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray и многое другое. MLflow или ваши собственные инструменты могут сохранять артефакты модели в открытых форматах, чтобы их можно было экспортировать и запускать за пределами Azure Databricks.

MLflow — это открытый код, созданный Azure Databricks и используемый 10 000+ организациями. Данные отслеживания экспериментов, артефакты модели и определения конвейера хранятся в открытых форматах.

Управление данными и ИИ основаны на API каталога Unity с открытым исходным кодом, а хранилище данных основано на открытом формате Delta Lake . Ваши данные функций и обучающие наборы данных остаются открытыми, переносимыми файлами.

Дополнительные ресурсы