Получение и подготовка данных
Основой машинного обучения являются данные. Количество данных и качество данных влияют на точность модели.
Чтобы обучить модель машинного обучения, необходимо выполнить следующие действия.
- Определите источник данных и формат.
- Выберите способ обслуживания данных.
- Разработка решения приема данных.
Чтобы получить и подготовить данные , используемые для обучения модели машинного обучения, необходимо извлечь данные из источника и сделать его доступными для службы Azure, которую вы хотите использовать для обучения моделей или прогнозирования.
Определение источника данных и форматирования
Сначала необходимо определить источник данных и его текущий формат данных.
| Определение | Примеры |
|---|---|
| Источник данных | Например, данные могут храниться в системе управления отношениями клиентов (CRM), в транзакционной базе данных, такой как база данных SQL, или создаваться устройством Интернета вещей (IoT). |
| Формат данных | Необходимо понять текущий формат данных, которые могут быть табличными или структурированными данными, полуструктурированными или неструктурированными данными. |
Затем необходимо решить, какие данные нужны для обучения модели, а также в каком формате эти данные должны подаваться модели.
Разработка решения приема данных
Как правило, рекомендуется извлекать данные из источника перед его анализом. Независимо от того, используете ли вы данные для инженерии данных, анализа данных или науки о данных, вам нужно извлечь данные из их источника, преобразовать их и загрузить в слой обслуживания. Такой процесс также называется извлечением, преобразованием и загрузкой (ETL) или извлечением, загрузкой и преобразованием (ELT). Слой предоставления данных делает ваши данные доступными для сервиса, который вы используете для дальнейшей обработки данных, например для обучения моделей машинного обучения.
Для перемещения и преобразования данных можно использовать конвейер приема данных. Конвейер приема данных — это последовательность задач, которые перемещают и преобразуют данные. Создав конвейер, можно вручную активировать задачи или запланировать конвейер, если требуется, чтобы задачи были автоматизированы. Такие конвейеры можно создавать с помощью служб Azure, таких как Azure Synapse Analytics, Azure Databricks, а также Машинное обучение Azure.
Распространенный подход к решению приема данных заключается в том, чтобы:
- Извлечение необработанных данных из источника (например, системы CRM или устройства Интернета вещей).
- Скопируйте и преобразуйте данные с помощью Azure Synapse Analytics.
- Сохраните подготовленные данные в Хранилище BLOB-объектов Azure.
- Обучите модель с помощью Машинное обучение Azure.
Ознакомьтесь с примером
Представьте, что вы хотите обучить модель прогнозирования погоды. Вы предпочитаете одну таблицу, в которой объединяются все измерения температуры на компьютере. Вы хотите создать агрегаты данных и иметь таблицу со средней температурой для каждой машины за каждую минуту. Чтобы создать таблицу, необходимо преобразовать полуструктурированные данные, принимаемые с устройства Интернета вещей, который измеряет температуру с интервалами в табличные данные.
Например, чтобы создать набор данных, который можно использовать для обучения модели прогнозирования, можно:
- Извлеките измерения данных в виде объектов JSON с устройств Интернета вещей.
- Преобразуйте объекты JSON в таблицу.
- Преобразуйте данные, чтобы получить температуру для каждой машины за минуту.
Далее давайте рассмотрим службы, которые можно использовать для обучения моделей машинного обучения.