Комплексный сценарий обработки и анализа данных: введение и архитектура

Эти руководства представляют полный сквозной сценарий в среде Fabric для анализа данных. Они охватывают каждый шаг, начиная

  • Прием данных
  • Очистка данных
  • Подготовка данных

до

  • Обучение модели машинного обучения
  • Создание аналитических сведений

а затем охватить потребление этих инсайтов с помощью инструментов визуализации — например, Power BI.

Новичкам в Microsoft Fabric стоит посетить «Что такое Microsoft Fabric?».

Знакомство

Жизненный цикл проекта в области науки о данных обычно включает следующие этапы:

  • Понимайте бизнес-правила
  • Получить данные
  • Исследуй, очищай, готовь и визуализируй данные
  • Обучайте модель и отслеживайте эксперимент
  • Оценивайте модель и генерируйте инсайты

Шаги часто проходят итеративно. Цели и критерии успеха каждого этапа зависят от сотрудничества, обмена данными и документации. Опыт науки о данных Fabric включает множество встроенных функций, которые обеспечивают бесшовное сотрудничество, сбор, обмен и потребление данных.

Эти обучающие материалы ставят вас в роль дата-сайентиста, который должен исследовать, очищать и преобразовывать набор данных, содержащий статус оттока 10 000 банковских клиентов. Затем вы создаёте модель машинного обучения, чтобы предсказать, какие клиенты банка, скорее всего, уйдут.

В уроках вы выполняете следующие действия:

  1. Используйте ноутбуки Fabric для сценариев науки о данных
  2. Используйте Apache Spark для загрузки данных в Fabric lakehouse
  3. Загрузите существующие данные из таблиц Delta в Lakehouse
  4. Используйте Apache Spark и инструменты на базе Python для очистки и преобразования данных
  5. Создавайте эксперименты и запуски для обучения различных моделей машинного обучения
  6. Используйте MLflow и интерфейс Fabric для регистрации и отслеживания обученных моделей
  7. Выполняйте скоринг в любом масштабе и сохраняйте прогнозы и результаты инференса в Lakehouse
  8. Используйте режим Direct Lake в Power BI для визуализации прогнозов

Архитектура

Эта серия обучающих материалов демонстрирует упрощённый сквозной сценарий науки о данных, включающий:

  1. Получение данных из внешнего источника данных.
  2. Исследование и очистка данных.
  3. Обучение и регистрация моделей машинного обучения.
  4. Пакетная оценка и сохранение прогнозов.
  5. Визуализация прогнозируемых результатов в Power BI.

схема комплексных компонентов сценария обработки и анализа данных.

Различные компоненты сценария обработки и анализа данных

Источники данных — чтобы получать данные через Fabric, вы можете легко и быстро подключиться к Azure Data Services, другим облачным платформам и локальным ресурсам данных. С помощью Fabric Notebooks вы можете получать данные из следующих ресурсов:

  • Встроенные лейкхаусы
  • Хранилища данных
  • Семантические модели
  • Различные источники данных Apache Spark
  • Различные источники данных, поддерживающие Python

Эта серия руководств посвящена приёму и загрузке данных из lakehouse.

Исследуйте, очищайте и готовьте — опыт Fabric Data Science поддерживает очистку, трансформацию, исследование и материализацию данных. Он использует встроенный опыт Spark и инструменты на базе Python — например, Data Wrangler и библиотека SemPy. Этот урок демонстрирует исследование данных с seaborn помощью библиотеки Python, а также очистку и подготовку данных с помощью Apache Spark.

Модели и эксперименты — с помощью Fabric вы можете тренировать, оценивать и оценивать модели машинного обучения с помощью встроенных экспериментов. Для регистрации и развертывания ваших моделей, а также отслеживания экспериментов, MLflow предлагает бесшовную интеграцию с Fabric как способ моделирования элементов. Чтобы узнать о новейших возможностях трассировки, включая LoggedModel трассировку сущностей и генеративного ИИ, см. MLflow 3 в Fabric Data Science. Для создания и обмена бизнес-инсайтами Fabric предлагает другие функции для масштабного прогнозирования моделей (PREDICT), чтобы создавать и делиться бизнес-инсайтами.

Storage — Fabric стандартизируется на Delta Lake, что означает, что все движки Fabric могут взаимодействовать с одним и тем же набором данных, хранящимся в озёрном доме. На этом уровне хранения можно хранить как структурные, так и неструктурированные данные, поддерживающие как файловое, так и табличное форматирование. Вы можете легко получить доступ к наборам данных и хранимым файлам через все элементы опыта Fabric — например, блокноты и конвейеры.

Открывайте доступ к аналитике и ценной информации — Power BI, ведущий в отрасли инструмент бизнес-аналитики, может использовать данные в lakehouse для создания отчетов и визуализаций. В ресурсах ноутбуков используются нативные библиотеки визуализации Python или Spark

  • matplotlib
  • seaborn
  • plotly
  • и так далее.

может визуализировать данные, сохраняющиеся в доме на озере. Библиотека SemPy также поддерживает визуализацию данных. Эта библиотека поддерживает встроенные насыщенные, специфичные визуализации для задач

  • Семантическая модель данных
  • Зависимости и их нарушения
  • Классификация и регрессионные сценарии использования

Следующий шаг