Итеративная разработка и отладка с помощью конвейеров Фабрика данных Azure и Synapse Analytics

ПРИМЕНИМО К: Фабрика данных Azure Azure Synapse Analytics

Совет

Data Factory в Microsoft Fabric — это следующее поколение Фабрика данных Azure с более простой архитектурой, встроенным ИИ и новыми функциями. Если вы не знакомы с интеграцией данных, начните с Fabric Data Factory. Существующие рабочие нагрузки ADF могут обновляться до Fabric для доступа к новым возможностям в области обработки и анализа данных, аналитики в режиме реального времени и отчетов.

Фабрика данных Azure и Synapse Analytics поддерживают итеративную разработку и отладку конвейеров. Эти функции позволяют тестировать изменения перед созданием пулл-реквеста или публикацией их на платформе.

Общие сведения об этой функции и ее демонстрацию см. в следующем 8-минутном видео:

Отладка конвейера

Создав конвейер с помощью холста, вы можете тестировать его действия с помощью функции отладки. До выбора команды Отладка при выполнении тестовых запусков не нужно публиковать изменения в службе. Это помогает в сценариях, когда перед обновлением рабочих процессов необходимо убедиться, что изменения работают, как и ожидалось.

Возможность отладки на интерфейсе конвейера

Когда конвейер запущен, результат каждого действия можно видеть на вкладке Выходные данные холста конвейера.

Просмотреть результаты тестовых запусков можно в окне Выходные данные на холсте конвейера.

Выходное окно на панели конвейера

После успешных тестовых запусков добавьте дополнительные действия в конвейер и продолжайте отладку итеративным методом. В ходе выполнения тестового запуска также можно нажать кнопку Отмена.

Внимание

Если выбрать функцию Отладка, конвейер будет запущен. Например, если в конвейере находится действие копирования, при тестовом запуске данные скопируются из источника в место назначения. По этой причине мы рекомендуем использовать тестовые папки в действиях копирования и других связанных процессах при отладке. После отладки конвейера переключитесь на фактические папки, которые нужно использовать во время обычной работы.

Задание точек останова

Служба позволяет выполнять отладку конвейера до тех пор, пока не будет достигнуто определенное действие на холсте конвейера. Установите точку останова на действие, которое необходимо тестировать, и выберите Отладка. Сервис гарантирует, что тест будет выполняться только до указанной точки останова на холсте конвейера. Функцию Debug Until можно использовать, когда необходимо проверить не весь конвейер, а только подмножество действий внутри него.

Точки останова на холсте конвейера

Чтобы задать точку останова, выберите элемент на холсте конвейера. Параметр Отладка до момента появляется в виде пустого красного круга в правом верхнем углу элемента.

До установки точки останова на выбранный элемент

Когда вы выберете параметр До отладки, он изменится на заполненный красный круг, указывающий на включение точки останова.

После установки точки останова для выбранного элемента

Мониторинг отладочных прогонов

При выполнении отладки конвейера результаты будут отображаться в окне Выходные данные на холсте конвейера. На вкладке "Выходные данные" будет содержаться только последнее выполнение, произошедшее во время текущего сеанса работы в браузере.

Выходное окно на панели конвейера

Для просмотра журнала запусков отладки или просмотра списка всех активных запусков отладки можно перейти к Монитору.

Примечание.

Служба сохраняет историю выполнения отладки только в течение 15 дней.

Отладка сопоставления потоков данных

Потоки данных для сопоставления позволяют создавать логику преобразования данных без написания кода, которая выполняется в большом масштабе. При разработке логики можно включить сеанс отладки для интерактивной работы с данными с помощью активного кластера Spark. Чтобы узнать больше, прочитайте о режиме отладки сопоставления потока данных.

Активные сеансы отладки потока данных можно отслеживать на странице Мониторинг.

Просмотр сеансов отладки потока данных

Предварительный просмотр данных в конструкторе потоков данных и отладка конвейеров потоков данных лучше всего работают с небольшими порциями данных. Однако если вам нужно протестировать логику в конвейере или потоке данных с большими объемами данных, увеличьте размер Azure Integration Runtime, используемых в сеансе отладки с большим количеством ядер и минимальными вычислениями общего назначения.

Отладка конвейера с помощью действия "Поток данных"

При выполнении отладки конвейера с потоком данных у вас есть два варианта выбора вычислительных ресурсов. Можно либо использовать существующий кластер отладки, либо запустить новый JIT-кластер для потоков данных.

Использование существующего сеанса отладки значительно сокращает время запуска потока данных, так как кластер уже выполняется, но не рекомендуется для сложных или параллельных рабочих нагрузок, так как может произойти сбой при одновременном запуске нескольких заданий.

При использовании среды выполнения действий будет создан новый кластер с параметрами, заданными в каждой среде выполнения интеграции действия потока данных. Это позволяет изолировать каждое задание и использовать его для сложных рабочих нагрузок или тестирования производительности. Вы также можете контролировать срок жизни в Azure IR, чтобы ресурсы кластера, используемые для отладки, по-прежнему будут доступны в течение этого периода времени для обслуживания дополнительных запросов заданий.

Примечание.

Если у вас есть поток с потоками данных, выполняемыми параллельно, или потоками данных, которые необходимо протестировать с большими наборами данных, выберите "Use Activity Runtime", чтобы служба могла использовать выбранный вами в действии потока данных Integration Runtime. Это позволит потокам данных выполняться на нескольких кластерах и справиться с параллельным выполнением потоков данных.

Выполнение конвейера с потоком данных

После тестирования изменений распространяйте их на среды более высокого уровня, используя непрерывную интеграцию и развертывание.