Декларативные конвейеры Spark

Декларативные конвейеры Apache Spark™ — это декларативная платформа для создания конвейеров данных пакетной и потоковой передачи в SQL и Python. Конвейеры Lakeflow расширяются и взаимодействуют с декларативными конвейерами Spark при выполнении в среде выполнения Databricks, оптимизированной для производительности. Распространенные варианты использования конвейеров включают прием данных из таких источников, как облачное хранилище (например, Amazon S3, Azure ADLS 2-го поколения и Google Cloud Storage) и автобусы сообщений (например, Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub и Apache Pulsar), а также добавочные пакетные и потоковые преобразования.

Замечание

Для конвейеров Lakeflow требуется тарифный план Premium. Чтобы получить дополнительные сведения, обратитесь к группе учетной записи Databricks.

В этом разделе содержатся подробные сведения об использовании конвейеров. Следующие разделы помогут вам приступить к работе.

Тема Description
Основные понятия конвейера Узнайте о высокоуровневых концепциях конвейеров, включая потоки, потоковые таблицы и материализованные представления.
Учебники Следуйте инструкциям, чтобы получить практический опыт работы с использованием конвейеров.
Разработка конвейеров Узнайте, как разрабатывать и тестировать конвейеры, которые создают потоки для приема и преобразования данных.
Настроить трубопроводы Узнайте, как запланировать и настроить конвейеры.
Мониторинг конвейеров Узнайте, как контролировать ваши конвейерные линии и решать проблемы с запросами в работе конвейерных линий.
Разработчики Узнайте, как использовать Python и SQL при разработке конвейеров.
Автономные конвейеры Узнайте о создании автономных таблиц потоковой передачи и материализованных представлений в Databricks SQL или Python.
Рекомендации Узнайте о рекомендуемых шаблонах для создания надежных, эффективных и обслуживаемых конвейеров.

Дополнительные ресурсы