Разработка и отладка конвейеров ETL с помощью редактора конвейеров Lakeflow

Вы разрабатываете и отлаживаете конвейеры ETL (извлечение, преобразование и загрузка) в редакторе Lakeflow Pipelines — интегрированной среде разработки, созданной для разработки конвейеров.

Что такое редактор потоков Lakeflow?

Редактор Конвейеров Lakeflow — это интегрированная среда разработки для разработки конвейеров. Он объединяет все задачи разработки конвейеров на одной поверхности, поддерживая рабочие процессы на основе кода, организацию кода на основе папок, выборочное выполнение, предварительный просмотр данных и графы конвейеров. Интегрированная с платформой Azure Databricks, она также включает управление версиями, проверки кода и запланированные запуски.

Обзор пользовательского интерфейса редактора конвейеров Lakeflow

На следующем изображении показан редактор конвейеров Lakeflow.

Редактор конвейеров Lakeflow

На изображении показаны следующие функции:

  1. Браузер ресурсов конвейера: создание, удаление, переименование и упорядочение ресурсов конвейера. Также включает сочетания клавиш для конфигурации конвейера.
  2. Редактор кода с несколькими файлами с вкладками: работа между несколькими файлами кода, связанными с конвейером.
  3. Панель инструментов для конкретного конвейера: включает параметры конфигурации конвейера и выполняет действия на уровне конвейера.
  4. Интерактивный график конвейера: получение обзора таблиц, открытие предварительных просмотров данных на нижней панели и выполнение других действий, связанных с таблицами.
  5. Аналитика выполнения на уровне таблицы: получение аналитических сведений о выполнении для всех таблиц или одной таблицы в конвейере. Аналитические сведения относятся к последнему запуску конвейера.
  6. Панель проблем: эта функция содержит сведения об ошибках, предупреждениях и аналитических сведениях во всех файлах в конвейере, и вы можете перейти к месту возникновения ошибки внутри определенного файла. Он дополняет индикаторы ошибок, прикрепленных к коду.
  7. Выборочное выполнение. Редактор кода имеет функции пошаговой разработки, такие как возможность обновления только таблиц в текущем файле с помощью действия запуска файла или обновления одной таблицы.
  8. Значок кода Sparkle genie. Код Genie: создание, обновление и отладка конвейеров с помощью Genie Code, агентического интерфейса, который автоматизирует многофакторные рабочие процессы от обнаружения данных и создания кода до выполнения конвейера и устранения проблем с качеством данных.

Другие важные функции:

Создание конвейера ETL

Чтобы создать новый конвейер ETL с помощью редактора конвейеров Lakeflow, выполните следующие действия:

  1. В верхней части боковой панели щелкните значок Новый и выберите значок конвейера.Конвейер ETL.

    Конвейер создается автоматически со следующими параметрами по умолчанию:

    Эти параметры можно настроить на панели инструментов конвейера.

  2. Вверху присвойте конвейеру уникальное имя.

  3. Рядом с именем отображается каталог по умолчанию и схема.

    Каталог по умолчанию и схема по умолчанию — это место, в котором наборы данных считываются или записываются, когда наборы данных не соответствуют каталогу или схеме в коде. Дополнительные сведения см. в разделе "Объекты базы данных" в Azure Databricks .

    Щелкните каталог и схему, чтобы изменить значения по умолчанию для конвейера.

  4. По умолчанию в конвейере есть пустой файл my_transformation. Переключите этот файл между Python и SQL, выбрав из раскрывающегося списка языков. Напишите код непосредственно в этом файле или выберите один из следующих вариантов, чтобы быстро приступить к работе:

    • Значок Sparkle Genie Code. Создавайте с помощью Genie Code: опишите свой конвейер на естественном языке, и Genie Code соберёт его для вас.
    • Используйте пример кода: создайте структуру папок по умолчанию и пример кода на языке текущего файла.

    Новый my_transformation исходный файл с параметрами.

    Чтобы открыть дополнительные параметры, разверните меню Kebab menu icon.значка kebab. (справа от кнопки Code icon.Code icon.Использовать пример кода рядом со ), чтобы:

    • Добавьте существующий исходный код: свяжите конвейер с файлами кода, уже доступными в рабочей области, включая папки Git.
    • Настройка в качестве управляемого источника: используйте проект декларативных пакетов автоматизации для управления версиями и поддержки CI/CD. См. статью "Создание управляемого источником конвейера".
    • Используйте хранилище метаданных Hive: создайте конвейер с устаревшими параметрами.

Кроме того, можно создать конвейер ETL из браузера рабочей области:

  1. Щелкните рабочую область на левой панели.
  2. Выберите любую папку, включая папки Git.
  3. Щелкните "Создать " в правом верхнем углу и щелкните конвейер ETL.

Вы также можете создать конвейер ETL на странице заданий и конвейеров:

  1. В рабочей области щелкните на значок рабочих процессовЗадания и конвейеры на боковой панели.
  2. В меню Создать нажмите Конвейер ETL.

Подсказка

Интерфейс командной строки Databricks предоставляет команды для создания, изменения и управления конвейерами из терминала. Смотрите pipelines группу команд.

Открытие существующего конвейера ETL

Существует несколько способов открытия существующего конвейера ETL в редакторе Конвейеров Lakeflow:

  • Откройте любой исходный файл, связанный с конвейером:

    1. Щелкните рабочее пространство на боковой панели.
    2. Перейдите в папку с файлами исходного кода для конвейера.
    3. Щелкните файл исходного кода, чтобы открыть конвейер в редакторе.
  • Откройте недавно измененный конвейер:

    • В редакторе можно перейти к другим конвейерам, которые вы недавно изменили, щелкнув имя конвейера в верхней части браузера активов и выбрав другой конвейер из появиющегося списка последних.
    • Из редактора, на странице Последние на левой боковой панели, откройте конвейер или файл, сконфигурированный в качестве исходного кода для конвейера.
  • При просмотре потока данных в пределах продукта, вы можете редактировать его:

    • На странице мониторинга конвейера щелкните значок карандаша.Изменение конвейера.
    • На странице "Задания и конвейеры" на левой боковой панели щелкните значок карандаша. Чтобы изменить конвейер.
    • При редактировании задания и добавлении задачи конвейера можно нажать значок , когда вы выбираете конвейер в разделе Конвейер.
  • Если вы просматриваете все файлы в браузере активов и открываете файл исходного кода из другого конвейера, баннер отображается в верхней части редактора, предлагая открыть связанный конвейер.

Браузер ресурсов конвейера

При редактировании конвейера на боковой панели левой рабочей области используется специальный режим, называемый браузером ресурсов конвейера. По умолчанию браузер активов конвейера фокусируется на корневом каталоге конвейера и папках и файлах в корневом каталоге. Вы также можете выбрать отображение всех файлов, чтобы увидеть файлы за пределами корневого каталога пайплайна. Вкладки, открытые в редакторе конвейера при редактировании конкретного конвейера, запоминаются, и при переключении на другой конвейер восстанавливаются вкладки, которые были открыты в последний раз, когда вы редактировали этот конвейер.

Замечание

Редактор также имеет контексты для редактирования ФАЙЛОВ SQL (называемых редактором Databricks SQL) и общего контекста для редактирования файлов рабочей области, которые не являются файлами SQL или файлами конвейера. Каждый из этих контекстов запоминает и восстанавливает вкладки, которые вы открыли при последнем открытии этого контекста. Контекст можно переключить из верхней части левой боковой панели. Щелкните заголовок, чтобы выбрать между рабочими областями, редактором SQL или недавно измененными конвейерами.

Переключение контекстов редактора

При открытии файла на странице браузера рабочей области он открывается в соответствующем редакторе для этого файла. Если файл связан с конвейером, то это редактор Lakeflow Pipelines.

Чтобы открыть файл, который не является частью конвейера, но сохранить контекст конвейера, откройте файл на вкладке "Все файлы " браузера ресурсов.

В браузере активов конвейера есть две вкладки:

  • Конвейер. Здесь можно найти все файлы, связанные с конвейером. Вы можете создавать, удалять, переименовать и упорядочивать их в папках. Эта вкладка также включает сочетания клавиш для конфигурации конвейера и графическое представление последних запусков.
  • Все файлы: все остальные ресурсы рабочей области доступны здесь. Это может быть полезно для поиска файлов для добавления в конвейер или просмотра других файлов, связанных с конвейером, таких как ФАЙЛ YAML, определяющий декларативные пакеты автоматизации.

Браузер ресурсов конвейера

В конвейере можно использовать следующие типы файлов:

Это важно

Необходимо использовать браузер ресурсов конвейера на вкладке "Конвейер" для управления файлами и папками для конвейера. Это правильно обновляет параметры конвейера. Перемещение или переименование файлов и папок из браузера рабочей области или вкладка "Все файлы " разбивает конфигурацию конвейера, а затем ее необходимо устранить вручную в параметрах.

Корневая папка

Браузер ресурсов конвейера привязан к корневой папке конвейера. При создании нового конвейера корневая папка конвейера создается в домашней папке пользователя.

В браузере ресурсов конвейера можно изменить корневую папку. Это полезно, если вы создали конвейер в папке, а затем хотите переместить все в другую папку. Например, вы создали конвейер в обычной папке и хотите переместить исходный код в папку Git для управления версиями.

  1. Щелкните значок меню Kebab наверху корневой папки, чтобы открыть его дополнительное меню.
  2. Нажмите кнопку "Настроить новую корневую папку".
  3. В разделе "Корневая папка конвейера" щелкните значок папки и выберите другую папку в качестве корневой папки конвейера.
  4. Нажмите кнопку Сохранить.

Изменение корневой папки конвейера

На значке меню Kebab для корневой папки можно также нажать кнопку "Переименовать корневую папку ", чтобы переименовать имя папки. Здесь можно также щелкнуть "Переместить корневую папку ", чтобы переместить корневую папку, например в папку Git.

Вы также можете изменить корневую папку конвейера в параметрах:

  1. Нажмите кнопку "Параметры".
  2. В разделе "Ресурсы кода" щелкните "Настройка путей".
  3. Щелкните значок папки , чтобы изменить папку в корневой папке конвейера.
  4. Нажмите кнопку Сохранить.

Замечание

Если изменить корневую папку конвейера, то список файлов, отображаемый браузером ресурсов конвейера, затрагивается, так как файлы в предыдущей корневой папке отображаются как внешние файлы.

Существующий конвейер без корневой папки

Существующий конвейер, созданный с помощью устаревшего интерфейса редактирования записной книжки , не будет настроена корневая папка. Если вы открыли конвейер, для которого не настроена корневая папка, и хотите настроить корневую папку для этого конвейера, выполните следующие действия.

  1. В браузере активов конвейера нажмите кнопку "Настроить".
  2. Щелкните значок папки , чтобы выбрать корневую папку в корневой папке конвейера.
  3. Нажмите кнопку Сохранить.

Корневая папка конвейера отсутствует

Структура папок по умолчанию

При создании нового конвейера создается структура папок по умолчанию. Это рекомендуемая схема для организации исходных и неисходных файлов кода потока, как описано ниже.

Небольшое количество примеров файлов кода создаются в этой структуре папок.

Имя папки Рекомендуемое расположение для этих типов файлов
<pipeline_root_folder> Корневая папка, содержащая все папки и файлы для конвейера.
transformations Файлы исходного кода, такие как файлы кода Python или SQL с определениями таблиц.
explorations Файлы кода, отличные от исходного кода, такие как записные книжки, запросы и файлы кода, используемые для анализа аналитических данных.
utilities Файлы, отличные от исходного кода, с модулями Python, которые можно импортировать из других файлов кода. Если вы выбрали SQL в качестве языка для примера кода, эта папка не создается.

Имена папок можно переименовать или изменить структуру, чтобы она соответствовала рабочему процессу. Чтобы добавить новую папку исходного кода, выполните следующие действия.

  1. Нажмите кнопку «Добавить» в браузере ресурсов конвейера.
  2. Щелкните "Создать папку исходного кода конвейера".
  3. Введите имя папки и нажмите кнопку "Создать".

Файлы исходного кода

Файлы исходного кода являются частью определения исходного кода конвейера. При запуске конвейера эти файлы оцениваются. Файлы и папки, входящие в определение исходного кода, имеют специальный значок с маленьким изображением конвейера.

Чтобы добавить новый файл исходного кода, выполните следующее:

  1. Щелкните значок Рядом с корневой папкой.
  2. Щелкните Преобразование.
  3. Введите имя файла и выберите Python или SQL в качестве языка.
  4. Нажмите кнопку "Создать".

Используйте встроенные помощники, чтобы начать писать код с помощью значка кода Sparkle genie. Genie Code или создавать небольшие фрагменты кода для нужного типа набора данных (например, материализованного представления или потоковой таблицы).

Папка transformations для исходного кода создается по умолчанию при создании нового конвейера. Эта папка является рекомендуемой папкой для исходного кода конвейера, например файлов кода Python или SQL с определениями таблиц конвейера.

Файлы, отличные от исходного кода

Файлы кода, отличные от исходного кода, хранятся в корневой папке конвейера, но не являются частью определения исходного кода конвейера. Эти файлы не оцениваются при запуске конвейера. Файлы, отличные от исходного кода, не могут быть внешними файлами.

Это можно использовать для файлов, связанных с работой в конвейере, который вы хотите хранить вместе с исходным кодом. Рассмотрим пример.

  • Блокноты, которые вы используете для разовых исследований и которые выполняются на вычислительных ресурсах вне жизненного цикла конвейера.
  • Модули Python, которые не должны оцениваться с помощью исходного кода, если вы явно не импортируете эти модули в файлы исходного кода.

Чтобы добавить новый файл, отличный от исходного кода, выполните следующее:

  1. Щелкните значок Рядом с корневой папкой.
  2. Щелкните "Исследование" или "Утилита".
  3. Введите имя файла.
  4. Нажмите кнопку "Создать".

При создании нового конвейера по умолчанию создаются следующие папки для файлов, отличных от исходного кода:

Имя папки Description
explorations Эта папка — рекомендуемое место для записных книжек, запросов, панелей мониторинга и других файлов; здесь их можно запускать на вычислительных ресурсах, как это обычно делается вне цикла выполнения конвейера.
utilities Эта папка является рекомендуемым расположением для модулей Python, которые можно импортировать из других файлов с помощью прямых импортов, выраженных как from <filename> import, если их родительская папка иерархически находится под корневой папкой.

Вы также можете импортировать модули Python, расположенные вне корневой папки, но в этом случае необходимо добавить путь sys.path к папке в код Python:

import sys, os
sys.path.append(os.path.abspath('<alternate_path_for_utilities>/utilities'))
from utils import \*

Внешние файлы

В разделе "Внешние файлы " браузера конвейера отображаются файлы исходного кода за пределами корневой папки.

Чтобы переместить внешний файл в корневую папку, например в папку transformations, выполните следующие действия:

  1. Щелкните значок меню Kebab. Для файла в браузере ресурсов нажмите кнопку "Переместить".
  2. Выберите папку, в которую нужно переместить файл, и нажмите кнопку "Переместить".

Файлы, связанные с несколькими конвейерами

Значок отображается в заголовке файла, если файл связан с несколькими конвейерами. Он включает в себя количество связанных трубопроводов и позволяет переключаться между ними.

Раздел "Все файлы"

В дополнение к разделу Pipeline есть раздел "Все файлы ", где можно открыть любой файл в рабочей области. Здесь можно:

  • Откройте файлы вне корневой папки на вкладке без выхода из редактора Конвейеров Lakeflow.
  • Перейдите к файлам исходного кода другого конвейера и откройте их. Файл откроется в редакторе, и вы увидите баннер с опцией переключить фокус в редакторе на этот второй конвейер управляющих процессов.
  • Переместите файлы в корневую папку конвейера.
  • Включите файлы вне корневой папки в определение исходного кода конвейера.

Изменение исходных файлов конвейера

Когда вы открываете файл исходного кода конвейера в браузере рабочей области или в браузере ресурсов конвейера, он открывается на вкладке в редакторе Lakeflow Pipelines. Открытие дополнительных файлов открывает отдельные вкладки, позволяя одновременно редактировать несколько файлов.

Замечание

Открытие файла, который не связан с конвейером, из обозревателя рабочей области откроет редактор в другом контексте (либо общий редактор рабочей области, либо, для SQL-файлов, редактор SQL).

При открытии файла, не относящегося к конвейеру, на вкладке «Все файлы» браузера ресурсов конвейера он открывается в новой вкладке в контексте конвейера.

Исходный код конвейера содержит несколько файлов. По умолчанию исходные файлы находятся в папке transformations в обозревателе ресурсов конвейера. Файлы исходного кода могут быть файлами Python (*.py) или SQL (*.sql). Источник может включать в себя сочетание файлов Python и SQL в одном конвейере, а код в одном файле может ссылаться на таблицу или представление, определенное в другом файле.

Вы также можете включить файлы Markdown (*.md) в папку tranformations . Файлы Markdown можно использовать для документации или заметок, но игнорируются при запуске обновления конвейера.

Следующие функции относятся к редактору Конвейеров Lakeflow.

Изменение кода конвейера

  1. Подключение. Подключитесь к бессерверным или классическим вычислениям для запуска конвейера. Все файлы, связанные с конвейером, используют одно и то же вычислительное подключение, поэтому после подключения вам не нужно подключаться к другим файлам в одном конвейере. Дополнительные сведения о параметрах вычислений см. в разделе "Параметры конфигурации вычислений".

    Для файлов, отличных от конвейера, таких как исследовательская записная книжка, доступен вариант подключения, но применяется только к одному файлу.

  2. Запустите файл: запустите код для обновления таблиц, определенных в этом исходном файле. В следующем разделе описаны различные способы выполнения кода конвейера.

  3. Изменение. Используйте значок кода Sparkle genie. Genie Code для редактирования или добавления кода в файл.

  4. Быстрое исправление: Используйте значок Genie Code Sparkle. Genie Code, чтобы исправлять ошибки или применять рекомендации к вашему коду.

Нижняя панель также настраивается на основе текущей вкладки. Просмотр сведений о конвейере на нижней панели всегда доступен. Файлы, не связанные с конвейером, например, файлы редактора SQL, также выводятся на отдельной вкладке в нижней панели. На следующем рисунке показан вертикальный селектор вкладок, позволяющий переключать нижнюю панель между просмотром сведений о конвейере и информацией о выбранной записной книжке.

Селектор вертикальных закладок для обзорной записной книжки

Запуск кода конвейера

У вас есть четыре варианта запуска кода конвейера:

  1. Запуск всех файлов исходного кода в конвейере

    Нажмите кнопку "Запуск конвейера" или "Запуск конвейера" с полным обновлением таблицы, чтобы запустить все определения таблиц во всех файлах, определенных как исходный код конвейера. Дополнительные сведения о типах обновления см. в разделе " Семантика обновления конвейера".

    Запуск конвейера

    Вы также можете нажать кнопку "Сухой запуск" , чтобы проверить конвейер без обновления данных.

  2. Запуск кода в одном файле

    Нажмите кнопку "Запустить файл " или "Запустить файл" с полным обновлением таблицы , чтобы запустить все определения таблиц в текущем файле. Другие файлы в конвейере не оцениваются.

    Запуск файла

    Этот параметр полезен для отладки при быстром редактировании и итерации файла. При выполнении кода в одном файле существуют побочные эффекты.

    • Если другие файлы не оцениваются, ошибки в этих файлах не найдены.
    • Таблицы, материализованные в других файлах, используют самую последнюю материализацию таблицы, даже если есть более последние исходные данные.
    • Вы можете столкнуться с ошибками, если таблица, на которую имеется ссылка, еще не материализована.
    • Граф конвейера может быть некорректным или разрозненным для таблиц из других файлов, которые не были материализованы. Azure Databricks делает все возможное, чтобы обеспечить правильность графа, но не оценивает другие файлы для этого.

    После завершения отладки и редактирования файла Databricks рекомендует запускать все файлы исходного кода в конвейере, чтобы убедиться, что конвейер работает сквозно, прежде чем помещать конвейер в рабочую среду.

  3. Запуск кода для одной таблицы

    Рядом с определением таблицы в файле исходного кода щелкните значок запуска таблицы таблицу", а затем выберите "Обновить таблицу " или "Полная таблица обновления " в раскрывающемся списке. Выполнение кода для одной таблицы имеет аналогичные побочные эффекты, как выполнение кода в одном файле.

    Запуск таблицы

    Замечание

    Выполнение кода для одной таблицы доступно для потоковых таблиц и материализованных представлений. Приемники и представления не поддерживаются.

  4. Запуск кода для набора таблиц

    Вы можете выбрать таблицы из графа конвейера, чтобы создать список таблиц для запуска. Наведите указатель мыши на таблицу в графе конвейера, щелкните значок меню Kebab и выберите команду "Выбрать таблицу для обновления". После выбора таблиц для обновления выберите в нижней части схемы конвейера вариант «Выполнить» или «Выполнить с полным обновлением».

    Запуск выбранных таблиц

  5. Запуск выбранного кода

    Выделите код SQL и нажмите кнопку "Запустить выделенный код ", чтобы быстро проверить выходные данные без материализации данных. Выходные данные отображаются на вкладке "Результаты запроса " на нижней панели.

Граф конвейера

После того как вы выполнили или проверили все файлы исходного кода в конвейере, вы увидите граф конвейера, который также называется направленным ациклическим графом (DAG). На графе показан граф зависимостей таблицы. У каждого узла имеются различные состояния на протяжении жизненного цикла конвейера, такие как проверка, запуск или ошибка.

Граф конвейера, показывающий зависимости таблиц и состояния жизненного цикла в редакторе Lakeflow Pipelines.

  1. График конвейера: откройте граф, щелкнув вкладку "Граф конвейера " на нижней панели.
  2. Узлы: отображение зависимостей таблиц, которые являются частью конвейера, а также любых метрик, относящихся к ним. Узлы, которые являются частью открытых файлов, выделены в графе конвейера. При наведении указателя мыши на узел отображается панель инструментов с параметрами, включая обновление запроса. Щелкнув правой кнопкой мыши узел, вы можете выбрать те же параметры в контекстном меню. Щелчок по узлу показывает предварительный просмотр данных и определение таблицы. При редактировании файла таблицы, определенные в этом файле, выделены в графе.
  3. Открыть во вкладке: Чтобы развернуть график, щелкните значок в правом верхнем углу нижней панели, чтобы открыть его в отдельной вкладке.
  4. Дополнительные параметры: дополнительные параметры находятся в правом нижнем углу, включая параметры масштабирования и дополнительные параметры для отображения графа в вертикальном или горизонтальном макете.

Предварительные версии данных

В разделе предварительного просмотра данных показаны примеры данных для выбранной таблицы.

Вы увидите предварительный просмотр данных таблицы при щелчке узла в графе конвейера. Чтобы перейти к предварительному просмотру данных другой таблицы непосредственно на нижней панели, выберите "Назад к графу " или щелкните другой узел, если у вас есть граф конвейера, открытый на отдельной вкладке.

Кроме того, перейдите в раздел "Таблицы " и щелкните Значок предварительного просмотра данных для просмотра данныхLDP. Если вы выбрали таблицу, нажмите кнопку "Все таблицы ", чтобы вернуться ко всем таблицам.

При предварительном просмотре данных таблицы можно отфильтровать или отсортировать данные на месте. Если вы хотите выполнить более сложный анализ, можно использовать или создать записную книжку в папке "Исследование" (если вы сохранили структуру папок по умолчанию). По умолчанию исходный код в этой папке не выполняется во время обновления конвейера, поэтому можно создавать запросы без влияния на выходные данные конвейера.

Аналитические сведения о выполнении

Вы можете просмотреть аналитические сведения о выполнении таблицы о последнем обновлении конвейера на панелях в нижней части редактора.

Panel Description
Tables Перечисляет все таблицы, их состояния и метрики. Если выбрать одну таблицу, вы увидите метрики и производительность для этой таблицы и вкладку для предварительного просмотра данных. Для материализованных представлений столбец «Инкрементализация» показывает, как таблица была или будет обновляться, и предоставляет сведения об инкрементализации. См. сведения об инкрементализации.
Performance Журнал запросов и профили для всех потоков в этом конвейере. Вы можете получить доступ к метрикам выполнения и подробным планам запросов во время и после выполнения. Дополнительные сведения см. в истории запросов для конвейеров.
Панель проблем Щелкните панель для упрощенного представления ошибок, предупреждений и аналитических сведений для конвейера. Щелкните запись, чтобы просмотреть дополнительные сведения, а затем перейдите к месту в коде, где произошла ошибка. Если ошибка находится в файле, отличном от отображаемого в данный момент, это перенаправляет вас в файл, в котором находится ошибка.
Щелкните "Просмотреть сведения" , чтобы просмотреть соответствующую запись журнала событий для получения полных сведений. Щелкните Просмотреть журналы , чтобы просмотреть полный журнал событий.
Щелкните "Диагностика ошибки" , чтобы отладить проблему с значком кода Sparkle genie. Код Genie.
Индикаторы ошибок, прикрепленных к коду, отображаются для ошибок, связанных с определенной частью кода. Чтобы получить дополнительные сведения, щелкните значок ошибки или наведите указатель мыши на красную линию. Появится всплывающее окно с дополнительными сведениями. Затем можно нажать кнопку "Быстрое исправление" , чтобы выявить набор действий для устранения ошибки.
Журнал событий Все события, произошедшие во время последнего запуска конвейера. Щелкните Просмотреть журналы или любую запись в панели вопросов.

Конфигурация конвейера

Конвейер можно настроить из редактора конвейера. Вы можете внести изменения в параметры конвейера, расписание или разрешения.

К каждому из них можно получить доступ из кнопки в заголовке редактора или из значков в браузере активов (левая боковая панель).

  • Параметры (или выберите значок шестеренка в браузере Gear icon.ресурсов):

    Параметры конвейера можно изменить на панели параметров, включая общие сведения, корневую папку и конфигурацию исходного кода, конфигурацию вычислений, уведомления, дополнительные параметры и многое другое.

  • Расписание (или выберите значок календаря. в браузере активов):

    Вы можете создать одно или несколько расписаний для конвейера в диалоговом окне расписания. Например, если вы хотите запускать его ежедневно, вы можете установить это здесь. Он создает задание для запуска конвейера в выбранном расписании. Можно добавить новое расписание или удалить существующее расписание из диалогового окна расписания.

  • Поделиться (или, в меню «Кебаб» в обозревателе ресурсов выберите значок «Поделиться»):

    Вы можете управлять разрешениями в конвейере для пользователей и групп из диалогового окна разрешений конвейера.

Журнал событий

Журнал событий можно опубликовать для конвейера в каталоге Unity. По умолчанию журнал событий для конвейера отображается в пользовательском интерфейсе и доступен для запроса владельцем.

  1. Откройте параметры.
  2. Щелкните значок Шеврона вправо. Стрелка рядом с дополнительными параметрами.
  3. Нажмите кнопку "Изменить дополнительные параметры".
  4. В разделе "Журналы событий" нажмите кнопку "Опубликовать в каталоге".
  5. Укажите имя, каталог и схему для журнала событий.
  6. Нажмите кнопку Сохранить.

События вашего конвейера публикуются в указанной вами таблице.

Дополнительные сведения об использовании журнала событий конвейера см. в статье "Запрос журнала событий".

Среда конвейера

Вы можете создать среду для исходного кода, добавив зависимости в параметры.

  1. Откройте параметры.
  2. В разделе "Среда конвейера" щелкните "Изменить среду".
  3. Нажмите кнопку "Добавить зависимость" , чтобы добавить зависимость, как если бы вы добавили ее в requirements.txt файл. Дополнительные сведения о зависимостях см. в разделе "Добавление зависимостей в записную книжку".

Databricks рекомендует закрепить версию с помощью ==. Смотрите пакет PyPI.

Среда применяется ко всем файлам исходного кода в конвейере.

Уведомления

Вы можете добавлять уведомления с помощью параметров конвейера.

  1. Откройте параметры.
  2. В разделе "Уведомления" нажмите кнопку "Добавить уведомление".
  3. Добавьте один или несколько адресов электронной почты и укажите события, которые вы хотите отправить на эти адреса.
  4. Нажмите кнопку "Добавить уведомление".

Замечание

Создайте пользовательские ответы на события, включая уведомления или настраиваемую обработку, с помощью Python перехватчиков событий.

Мониторинг конвейеров

Azure Databricks также предоставляет функции для мониторинга запущенных конвейеров. В редакторе отображаются результаты и аналитические сведения о выполнении последнего запуска. Он оптимизирован для эффективной итерации при интерактивной разработке вашего конвейера.

Страница мониторинга конвейера позволяет просматривать исторические запуски, что полезно при выполнении конвейера по расписанию с помощью задания.

Замечание

Существует стандартный режим мониторинга и обновленный режим мониторинга в предварительной версии. В следующем разделе описывается, как включить или отключить предварительный просмотр мониторинга. Сведения об обоих интерфейсах см. в разделе "Мониторинг конвейеров" в пользовательском интерфейсе.

Интерфейс мониторинга доступен на кнопке "Задания и конвейеры" в левой части рабочей области. Вы также можете перейти непосредственно на страницу мониторинга из редактора, нажав на результаты выполнения в обозревателе ресурсов конвейера.

Ссылка на страницу мониторинга из редактора

Дополнительные сведения о странице мониторинга см. в разделе "Мониторинг конвейеров" в пользовательском интерфейсе. Пользовательский интерфейс мониторинга включает возможность вернуться в редактор Конвейеров Lakeflow, выбрав "Изменить конвейер " из заголовка пользовательского интерфейса.

Код Genie для разработки конвейеров

Это важно

Эта функция доступна в общедоступной предварительной версии.

Редактор конвейеров Lakeflow интегрируется с Genie Code, который может создавать, изменять и отлаживать целые конвейеры на основе запросов на естественном языке. Дополнительные сведения см. в разделе "Код Genie" для разработки конвейеров.

Ограничения и известные проблемы

Ознакомьтесь со следующими ограничениями и известными проблемами в редакторе конвейера ETL:

  1. Боковая панель браузера рабочей области не фокусируется на конвейере, если начать с открытия файла в explorations папке или записной книжке, так как эти файлы или записные книжки не являются частью определения исходного кода конвейера.

    Чтобы ввести режим фокусировки конвейера в браузере рабочей области, откройте файл, связанный с конвейером.

  2. Предварительные версии данных не поддерживаются для обычных представлений.

  3. Модули Python не обнаружены из UDF, даже если они находятся в вашей корневой папке или упомянуты в вашем sys.path. Доступ к этим модулям можно получить, добавив путь к sys.path внутри UDF, например: sys.path.append(os.path.abspath(“/Workspace/Users/path/to/modules”))

  4. %pip install не поддерживается для файлов (тип ассета по умолчанию в новом редакторе). В параметрах можно добавить зависимости. См. раздел Пайплайн среда.

    В качестве альтернативы, можно продолжать использовать %pip install из записной книжки, связанной с конвейером, в определении исходного кода.

Часто задаваемые вопросы

  1. Почему файлы и не записные книжки используются для исходного кода?

    Выполнение ноутбуков, основанных на ячейках, несовместимо с конвейерами. Стандартные функции записных книжек либо отключены, либо изменяются при работе с конвейерами, что приводит к путанице для пользователей, знакомых с поведением записной книжки.

    В редакторе Pipelines Lakeflow редактор файлов используется в качестве основы для редактора первого класса для конвейеров. Функции специально нацелены на конвейеры, как например таблица выполненияRun Table Iconзначок таблицы выполнения, а не на чрезмерное изменение знакомых функций с другим поведением.

  2. Можно ли использовать записные книжки в качестве исходного кода?

    Да, вы можете. Однако некоторые функции, такие как Запуск таблицы или Run Table IconЗапуск файла, отсутствуют.

    Если у вас есть существующий конвейер с использованием ноутбуков, он по-прежнему работает в новом редакторе. Однако Databricks рекомендует переключиться на файлы для новых конвейеров данных.

  3. Как добавить существующий код в только что созданный конвейер?

    В новый конвейер можно добавить существующие файлы исходного кода. Чтобы добавить папку с существующими файлами, выполните следующие действия.

    1. Нажмите кнопку "Параметры".
    2. В разделе "Исходный код" щелкните "Настройка путей".
    3. Щелкните "Добавить путь " и выберите папку для существующих файлов.
    4. Нажмите кнопку Сохранить.

    Вы также можете добавить отдельные файлы:

    1. Нажмите Все файлы в браузере ресурсов конвейера.
    2. Перейдите к файлу, щелкните значок меню Kebab и нажмите кнопку "Включить в конвейер".

    Рассмотрите возможность перемещения этих файлов в корневую папку конвейера. Если они находятся вне корневой папки конвейера, они отображаются в разделе "Внешние файлы ".

  4. Можно ли управлять исходным кодом конвейера в Git?

    Вы можете управлять источником конвейера в Git, выбрав папку Git при первоначальном создании конвейера.

    Замечание

    Управление источником в папке Git добавляет управление версиями для исходного кода. Однако для управления версиями конфигурации Databricks рекомендует использовать декларативные пакеты автоматизации для определения конфигурации конвейера в файлах конфигурации пакета, которые могут храниться в Git (или другой системе управления версиями). Дополнительные сведения см. в разделе "Что такое декларативные пакеты автоматизации?".

    Если вы изначально не создали конвейер в папке Git, можно переместить источник в папку Git. Databricks рекомендует использовать действие редактора для перемещения всей корневой папки в папку Git. Это обновляет все параметры соответствующим образом. См. корневую папку.

    Чтобы переместить корневую папку в папку Git в обозревателе ресурсов конвейера:

    1. Щелкните значок меню Kebab. Для корневой папки щелкните значок меню Kebab .
    2. Щелкните Переместить корневую папку.
    3. Выберите новое расположение корневой папки и нажмите кнопку "Переместить".

    Дополнительные сведения см. в разделе "Корневая папка ".

    После перемещения вы увидите знакомый значок Git рядом с именем корневой папки.

    Это важно

    Чтобы переместить корневую папку конвейера, используйте браузер ресурсов конвейера и описанные выше действия. Перемещение другим способом нарушает конфигурации конвейера, и вам необходимо вручную настроить правильный путь к папке в параметрах.

  5. Можно ли использовать несколько конвейеров в одной корневой папке?

    Вы можете, но Databricks рекомендует только один конвейер для каждой корневой папки.

  6. Когда следует запустить тестовый запуск?

    Нажмите кнопку "Сухой запуск" , чтобы проверить код, не обновляя таблицы.

  7. Когда следует использовать временные представления и когда следует использовать материализованные представления в коде?

    Используйте временные представления, если вы не хотите материализовать данные. Например, это шаг в последовательности шагов по подготовке данных, прежде чем он готов к материализации с помощью потоковой таблицы или материализованного представления, зарегистрированного в каталоге.