Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Эти руководства представляют полный сквозной сценарий в среде Fabric для анализа данных. Они охватывают каждый шаг, начиная
- Прием данных
- Очистка данных
- Подготовка данных
до
- Обучение модели машинного обучения
- Создание аналитических сведений
а затем охватить потребление этих инсайтов с помощью инструментов визуализации — например, Power BI.
Новичкам в Microsoft Fabric стоит посетить «Что такое Microsoft Fabric?».
Знакомство
Жизненный цикл проекта в области науки о данных обычно включает следующие этапы:
- Понимайте бизнес-правила
- Получить данные
- Исследуй, очищай, готовь и визуализируй данные
- Обучайте модель и отслеживайте эксперимент
- Оценивайте модель и генерируйте инсайты
Шаги часто проходят итеративно. Цели и критерии успеха каждого этапа зависят от сотрудничества, обмена данными и документации. Опыт науки о данных Fabric включает множество встроенных функций, которые обеспечивают бесшовное сотрудничество, сбор, обмен и потребление данных.
Эти обучающие материалы ставят вас в роль дата-сайентиста, который должен исследовать, очищать и преобразовывать набор данных, содержащий статус оттока 10 000 банковских клиентов. Затем вы создаёте модель машинного обучения, чтобы предсказать, какие клиенты банка, скорее всего, уйдут.
В уроках вы выполняете следующие действия:
- Используйте ноутбуки Fabric для сценариев науки о данных
- Используйте Apache Spark для загрузки данных в Fabric lakehouse
- Загрузите существующие данные из таблиц Delta в Lakehouse
- Используйте Apache Spark и инструменты на базе Python для очистки и преобразования данных
- Создавайте эксперименты и запуски для обучения различных моделей машинного обучения
- Используйте MLflow и интерфейс Fabric для регистрации и отслеживания обученных моделей
- Выполняйте скоринг в любом масштабе и сохраняйте прогнозы и результаты инференса в Lakehouse
- Используйте режим Direct Lake в Power BI для визуализации прогнозов
Архитектура
Эта серия обучающих материалов демонстрирует упрощённый сквозной сценарий науки о данных, включающий:
- Получение данных из внешнего источника данных.
- Исследование и очистка данных.
- Обучение и регистрация моделей машинного обучения.
- Пакетная оценка и сохранение прогнозов.
- Визуализация прогнозируемых результатов в Power BI.
Различные компоненты сценария обработки и анализа данных
Источники данных — чтобы получать данные через Fabric, вы можете легко и быстро подключиться к Azure Data Services, другим облачным платформам и локальным ресурсам данных. С помощью Fabric Notebooks вы можете получать данные из следующих ресурсов:
- Встроенные лейкхаусы
- Хранилища данных
- Семантические модели
- Различные источники данных Apache Spark
- Различные источники данных, поддерживающие Python
Эта серия руководств посвящена приёму и загрузке данных из lakehouse.
Исследуйте, очищайте и готовьте — опыт Fabric Data Science поддерживает очистку, трансформацию, исследование и материализацию данных. Он использует встроенный опыт Spark и инструменты на базе Python — например, Data Wrangler и библиотека SemPy. Этот урок демонстрирует исследование данных с seaborn помощью библиотеки Python, а также очистку и подготовку данных с помощью Apache Spark.
Модели и эксперименты — с помощью Fabric вы можете тренировать, оценивать и оценивать модели машинного обучения с помощью встроенных экспериментов. Для регистрации и развертывания ваших моделей, а также отслеживания экспериментов, MLflow предлагает бесшовную интеграцию с Fabric как способ моделирования элементов. Чтобы узнать о новейших возможностях трассировки, включая LoggedModel трассировку сущностей и генеративного ИИ, см. MLflow 3 в Fabric Data Science. Для создания и обмена бизнес-инсайтами Fabric предлагает другие функции для масштабного прогнозирования моделей (PREDICT), чтобы создавать и делиться бизнес-инсайтами.
Storage — Fabric стандартизируется на Delta Lake, что означает, что все движки Fabric могут взаимодействовать с одним и тем же набором данных, хранящимся в озёрном доме. На этом уровне хранения можно хранить как структурные, так и неструктурированные данные, поддерживающие как файловое, так и табличное форматирование. Вы можете легко получить доступ к наборам данных и хранимым файлам через все элементы опыта Fabric — например, блокноты и конвейеры.
Открывайте доступ к аналитике и ценной информации — Power BI, ведущий в отрасли инструмент бизнес-аналитики, может использовать данные в lakehouse для создания отчетов и визуализаций. В ресурсах ноутбуков используются нативные библиотеки визуализации Python или Spark
matplotlibseabornplotly- и так далее.
может визуализировать данные, сохраняющиеся в доме на озере. Библиотека SemPy также поддерживает визуализацию данных. Эта библиотека поддерживает встроенные насыщенные, специфичные визуализации для задач
- Семантическая модель данных
- Зависимости и их нарушения
- Классификация и регрессионные сценарии использования