Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Вы можете создать исходный код конвейера Python в предпочтительной интегрированной среде разработки (IDE), запустить его локально для тестирования, а затем проверить, развернуть и запустить обновления в рабочей области Azure Databricks без выхода из локальной среды.
Конвейеры Lakeflow — это супермножество декларативных конвейеров Apache Spark™. Код, использующий только API декларативных конвейеров Apache Spark, выполняется как локально, так и в Azure Databricks, но код, использующий функции, уникальные для конвейеров Lakeflow, таких как AUTO CDC и ожидания, выполняется только в Azure Databricks. Сведения о различиях в возможностях см. в справочнике по языку Python для конвейеров Lakeflow.
Для интерактивной разработки и тестирования в рабочей области Azure Databricks используйте редактор Lakeflow Pipelines. См. статью "Разработка и отладка конвейеров ETL" с помощью редактора конвейеров Lakeflow.
Написание кода конвейера с поддержкой интегрированной среды разработки
Напишите код конвейера с помощью модуля pyspark.pipelines, импортированного как dp:
from pyspark import pipelines as dp
Так как модуль является частью Apache Spark, интегрированная среда разработки предоставляет проверку синтаксиса, автозавершение и проверку типов при написании. Код Декларативных конвейеров Apache Spark обычно выполняется без изменения в Azure Databricks. Выполнение той же команды импорта в конвейере Lakeflow импортирует версию pipelines, используемую в Azure Databricks. Полное справочное руководство по Python для конвейеров Lakeflow см. в справочном руководстве по языку Python для конвейеров Lakeflow.
Запустите конвейеры локально для тестирования
Вы также можете локально запускать конвейеры для разработки и тестирования кода, прежде чем запускать его в Azure Databricks. Используйте интерфейс командной spark-pipelines строки для инициализации, проверки и запуска конвейера с помощью локального Apache Spark. См. руководство по программированию декларативных конвейеров Spark в документации по Apache Spark.
Вы не можете выполнять или тестировать функциональные возможности, относящиеся к конвейерам Lakeflow локально. Сюда входят ожидания и AUTO CDC функции.
Запуск конвейеров в Azure Databricks из локальной среды
Используйте группу databricks pipelines команд для проверки, развертывания и запуска обновлений конвейера в рабочей области непосредственно из терминала:
databricks pipelines init # scaffold a pipeline project
databricks pipelines dry-run # validate the pipeline graph without publishing data
databricks pipelines deploy # deploy the project to your workspace
databricks pipelines run # run an update
Обновления конвейера выполняются в рабочей области Azure Databricks, а не на локальном компьютере, используя вычислительные ресурсы, настроенные для конвейера. Эти команды взаимодействуют с командами bundle декларативных пакетов автоматизации, поэтому вы можете начать с простого проекта и применить конфигурацию пакета и методики CI/CD по мере роста. Сведения об установке и настройке интерфейса командной строки см. в статье "Установка или обновление интерфейса командной строки Databricks". Полный справочник по командам см. в разделе pipelinesгруппа команд. Пошаговое руководство по разработке конвейеров с помощью декларативных пакетов автоматизации.
Синхронизация потока кода из интегрированной среды разработки в рабочую область
В следующей таблице приведены варианты синхронизации исходного кода конвейера между локальной интегрированной среду разработки и рабочей областью Azure Databricks.
| Инструмент или шаблон | Сведения |
|---|---|
Databricks CLI (pipelines группа команд) |
Используйте команды databricks pipelines для развертывания и запуска проекта pipeline из локальной среды. Смотрите pipelines группу команд. |
| Декларативные пакеты автоматизации | Используйте декларативные пакеты автоматизации для развертывания ресурсов конвейера, начиная от одного файла исходного кода до конфигураций для нескольких конвейеров, заданий и файлов исходного кода. См. статью "Преобразование конвейера в проект пакета". |
| Расширение Databricks для Visual Studio Code | Azure Databricks обеспечивает интеграцию с Visual Studio Code, которая включает простую синхронизацию между локальными файлами интегрированной среды разработки и рабочей области. Это расширение также предоставляет средства для использования декларативных пакетов автоматизации для развертывания ресурсов конвейеров. См. расширение Databricks для Visual Studio Code. |
| Файлы рабочей области | Файлы рабочей области Databricks можно использовать для отправки исходного кода конвейера в рабочую область Databricks, а затем импортировать этот код в конвейер. См. раздел " Что такое файлы рабочей области?". |
| Папки Git | Папки Git позволяют синхронизировать код между локальной средой и Azure Databricks рабочей областью с помощью репозитория Git в качестве посредника. См. папки Git Azure Databricks. |