Переместите файл визуальной подготовки данных в продуктивную среду

Каждый файл подготовки визуальных данных, создаваемый в конструкторе Lakeflow, поддерживается готовым к работе кодом и хранится в виде записной книжки с именем <name>.designer.ipynb. Вы можете переместить его в рабочую среду с теми же инструментами, которые вы используете для других Azure Databricks кода: сохранить его в Git, запустить его в качестве задания и развернуть его с помощью декларативных пакетов автоматизации.

На этой странице описывается, как перевести файл визуальной подготовки данных от прототипа к промышленной эксплуатации.

Хранение и версия в Git

Рабочая область хранит файлы визуальной подготовки данных в собственном формате. Чтобы изменить файл подготовки визуальных данных, поместите его в папку Git и отслеживайте его как любую другую записную книжку:

  1. Создайте папку Git в рабочей области.
  2. Переместите файл подготовки визуальных данных в папку Git.
  3. Отслеживайте, фиксируйте изменения и ведите версионность файла в Git, как и для любого другого блокнота. В Git файл отображается как <file_name>.designer.ipynb.

Дополнительные сведения о папках Git см. в Папки Git в Azure Databricks. Сведения о экспорте или импорте файла подготовки визуальных данных см. в разделе "Экспорт и импорт файла подготовки визуальных данных".

Запланировать как задание

Вы можете автоматизировать файл подготовки визуальных данных, запланируя его как задание.

  • Запланируйте напрямую: нажмите кнопку "Расписание " в верхнем меню, чтобы создать запланированное задание для файла подготовки визуальных данных.
  • Добавьте в задание: создайте задание Azure Databricks и добавьте файл подготовки визуальных данных в качестве задачи. Это позволяет объединить этот файл подготовки визуальных данных с другими задачами в большом конвейере. В раскрывающемся списке "Тип задачи" выберите предварительное представление визуальных данных, а затем выберите файл.

Запланированные запуски отображают каждый оператор как отдельный узел в графе задач Jobs, чтобы вы могли просматривать результаты каждого оператора в рамках запуска так же, как на холсте.

Чтобы просмотреть существующие расписания и управлять ими, нажмите кнопку "Запланировать ", чтобы открыть список. Нажмите Добавить расписание, чтобы создать ещё одно, или откройте меню «Кебаб» расписания с помощью значка значок меню «Кебаб»., чтобы Изменить, Запустить сейчас, Приостановить, Клонировать, Просмотреть в заданиях или Удалить его.

Отображать вывод оператора во время выполнения

По умолчанию запланированное выполнение создает выходные данные только для операторов терминала (операторов без нижнего подключения), таких как оператор output. Чтобы увидеть результаты каждого оператора в ходе выполнения, разверните Дополнительные параметры в диалоговом окне расписания и выберите Показывать вывод операторов.

Параметр расписания LFD для автоматизации файла визуальной подготовки данных как задания.

Отключите этот параметр для больших холстов, чтобы избежать превышения предельного размера выходных данных выполнения.

Выбор бессерверной среды

При работе с файлом подготовки визуальных данных можно выбрать бессерверную среду, используемую для интерактивных запусков и запланированных заданий. Настройте это в боковой панели Environment icon.Environment icon.Среда на правой боковой панели, открываемой с помощью , так же, как и для блокнота. В базовой среде выберите версию среды. См. Настройте бессерверную среду.

Параметризация для разных сред

Параметры — это именованные значения, определенные для файла подготовки визуальных данных в целом, на которые можно ссылаться из операторов SQL и Python. Дополнительные сведения об определении и ссылке на параметры см. в разделе "Параметры".

Параметры позволяют использовать один и тот же файл визуальной подготовки данных в разных средах, например тестовый каталог в ходе разработки и рабочий каталог в рабочей среде.

  • При планировании задания в пользовательском интерфейсе: переопределите значения параметров для каждого расписания. Например, создайте одно расписание, в котором параметр environment имеет значение test, и другое — в котором этот параметр имеет значение production.
  • При развертывании с помощью пакета: задайте значения параметров с помощью задания parametersи используйте целевые объекты пакета для предоставления различных значений для среды. Целевые среды разработки и промышленной эксплуатации для пакета позволяют развертывать одну и ту же задачу в отдельных средах с параметрами, специфичными для каждой среды. См. режимы развертывания пакетов декларативной автоматизации и конфигурацию пакетов декларативной автоматизации.

Во время выполнения файл визуальной подготовки данных считывает свои параметры одинаково, независимо от того, выполняется ли он в интерактивном режиме или как задание, поэтому один и тот же файл работает во всех ваших средах без изменений.

Чтение из разных таблиц для каждой среды

Чтобы прочитать из другой исходной таблицы в каждой среде, используйте оператор SQL с параметрами вместо фиксированного оператора Source. Определите параметры catalog, schema и table, а затем ссылайтесь на них с помощью конструкции IDENTIFIER(), чтобы динамически сформировать имя таблицы:

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Переопределите параметры catalog, schema или table для каждого расписания или целевого объекта пакета, чтобы один и тот же файл визуальной подготовки данных использовал тестовые данные во время разработки и рабочие данные в продакшене. Дополнительные сведения о разделе IDENTIFIER() см. в IDENTIFIER разделе.

Развертывание с помощью декларативных пакетов автоматизации

Декларативные пакеты автоматизации позволяют определять и развертывать ресурсы Azure Databricks, такие как задания, в виде исходных файлов, что позволяет применять к файлам визуальной подготовки данных лучшие практики разработки ПО, такие как управление версиями, ревью кода, тестирование и CI/CD. См. что такое декларативные пакеты автоматизации.

Чтобы развернуть файл визуальной подготовки данных в составе пакета, определите задачу блокнота и укажите путь к файлу .designer.ipynb в notebook_task.notebook_path. В пакете файл подготовки визуальных данных использует notebook_task ключ, даже если пользовательский интерфейс заданий отображает его как тип задачи подготовки визуальных данных .

В следующем примере определяется задание, которое запускает файл подготовки визуальных данных, расположенный рядом с файлом конфигурации пакета:

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Разверните и запустите пакет с помощью интерфейса командной строки Azure Databricks:

databricks bundle deploy
databricks bundle run daily_prep_job

Полный набор ключей задач записной книжки см. в статье "Записная книжка". Полное пошаговое руководство по определению задания в пакете см. в статье "Разработка задания с помощью декларативных пакетов автоматизации".

Автоматизируйте с помощью CI/CD

Чтобы автоматически проверять и развертывать пакеты подготовки визуальных данных, интегрируйте их в конвейер CI/CD. Пример использования GitHub Actions см. в GitHub Actions.

Дополнительные ресурсы