Alur Deklaratif Spark

Apache Spark Declarative Pipelines adalah kerangka kerja deklaratif™ untuk membangun alur data batch dan streaming di SQL dan Python. Lakeflow pipelines merupakan perluasan dari Spark Declarative Pipelines dan interoperabel dengannya, sekaligus berjalan di atas Databricks Runtime yang dioptimalkan untuk performa. Kasus penggunaan umum untuk alur mencakup penyerapan data dari sumber seperti penyimpanan cloud (seperti Amazon S3, Azure ADLS Gen2, dan Google Cloud Storage) dan bus pesan (seperti Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub, dan Apache Pulsar), serta transformasi batch dan streaming tambahan.

Nota

Alur Lakeflow memerlukan paket Premium. Hubungi tim akun Databricks Anda untuk informasi selengkapnya.

Bagian ini menyediakan informasi terperinci mengenai penggunaan jalur pipa. Topik berikut membantu Anda memulai.

Topik Description
Konsep pipeline Pelajari tentang konsep alur tingkat tinggi, termasuk alur, tabel streaming, dan tampilan materialisasi.
Tutorial Ikuti tutorial untuk memberikan Anda pengalaman langsung dengan menggunakan pipeline.
Mengembangkan alur Pelajari cara mengembangkan dan menguji pipeline yang membuat aliran untuk mengambil dan mengubah data.
Mengonfigurasi jalur Pelajari cara menjadwalkan dan mengonfigurasi alur.
Memantau alur Pelajari cara memantau alur Anda dan memecahkan masalah kueri alur.
Pengembang Pelajari cara menggunakan Python dan SQL saat mengembangkan alur.
Pipeline mandiri Pelajari tentang membuat tabel streaming mandiri dan tampilan materialisasi di Databricks SQL atau Python.
Praktik Terbaik Pelajari pola yang direkomendasikan untuk membangun alur yang andal, efisien, dan dapat dipertahankan.

Sumber daya tambahan