Referensi sifat pipeline

Referensi untuk pengaturan konfigurasi alur JSON dan properti tabel. Untuk detail selengkapnya tentang menggunakan properti dan konfigurasi ini, lihat artikel berikut ini:

Konfigurasi alur Lakeflow dan Alur Deklaratif Apache Spark™

Alur Lakeflow dibangun di atas Apache Spark™ Declarative Pipelines (SDP). Konfigurasi alur sebagian besar merupakan superset dari spesifikasi proyek SDP. Perbedaan dalam penggunaan properti antara alur SDP dan Lakeflow dicatat. Untuk perbandingan kemampuan yang dibagikan alur Lakeflow dan SDP, lihat Alur Deklaratif Apache Spark.

Konfigurasi alur

  • id

    Jenis: string

    Pengidentifikasi unik global untuk pipa ini. Pengidentifikasi ditetapkan oleh sistem dan tidak dapat diubah.

    Hanya alur Lakeflow. SDP tidak menetapkan pengidentifikasi alur

  • name

    Jenis: string

    Nama yang mudah digunakan untuk alur ini. Nama dapat digunakan untuk mengidentifikasi pekerjaan pipeline di antarmuka pengguna.

    Tersedia di SDP sebagai bidang yang diperlukan name

  • configuration

    Jenis: object

    Daftar pengaturan opsional untuk ditambahkan ke konfigurasi Spark kluster yang menjalankan alur. Pengaturan ini dibaca oleh runtime alur dan tersedia untuk kueri alur melalui konfigurasi Spark.

    Elemen harus diformat sebagai pasangan key:value.

    Tersedia di SDP sebagai configuration

  • parameters

    Jenis: object

    Important

    Fitur ini ada di Beta. Admin ruang kerja dapat mengontrol akses ke fitur ini dari halaman Pratinjau . Lihat Kelola Pratinjau Azure Databricks.

    Peta opsional pasangan kunci-nilai yang dapat dirujuk kode sumber alur menggunakan sintaks parameter bernama (misalnya, :source_catalog). Gunakan parameter untuk menggunakan kembali kode sumber alur yang sama di seluruh lingkungan atau himpunan data tanpa mengedit sumbernya.

    Kunci dapat berisi karakter alfanumerik, garis bawah (_), tanda hubung (-), dan titik (.). Nilai selalu string.

    Anda dapat mengambil alih default ini saat memulai pembaruan, pada tugas alur dalam pekerjaan, atau dengan parameter pekerjaan yang didorong ke bawah. Parameter alur hanya dapat dirujuk dari kode sumber SQL. Lihat Menggunakan parameter dengan alur.

    Hanya alur Lakeflow

  • libraries

    Jenis: array of objects

    Sekumpulan file kode yang berisi kode pipeline dan artefak yang diperlukan.

    Tersedia di SDP sebagai libraries, ditentukan sebagai daftar pola glob file sumber daripada array objek file kode

  • clusters

    Jenis: array of objects

    Sekumpulan spesifikasi untuk kluster menjalankan jalur pemrosesan.

    Jika ini tidak ditentukan, alur secara otomatis memilih konfigurasi kluster default untuk alur.

    Hanya alur Lakeflow. SDP tidak mengelola komputasi

  • development

    Jenis: boolean

    Penanda yang menunjukkan apakah akan menjalankan pipeline dalam mode development atau production.

    Nilai defaultnya adalah false.

    Hanya alur Lakeflow

  • notifications

    Jenis: array of objects

    Array spesifikasi opsional untuk pemberitahuan email saat pembaruan pipeline selesai, gagal dengan kesalahan yang dapat diulang, gagal dengan kesalahan yang tidak dapat diulang, atau alur kerja gagal.

    Hanya alur Lakeflow

  • continuous

    Jenis: boolean

    Bendera yang menunjukkan apakah akan menjalankan pipeline secara terus-menerus.

    Nilai defaultnya adalah false.

    Hanya alur Lakeflow

  • catalog

    Jenis: string

    Nama katalog default untuk pipeline, di mana semua himpunan data dan metadata untuk pipeline tersebut diterbitkan. Mengatur nilai ini akan mengaktifkan Unity Catalog untuk pipeline.

    Jika dibiarkan tidak diatur, alur akan menerbitkan ke metastore Hive lama menggunakan lokasi yang ditentukan dalam storage.

    Dalam mode penerbitan lama, menentukan katalog yang berisi skema target di mana semua himpunan data dari alur kerja saat ini diterbitkan. Lihat skema LIVE (versi lama).

    Tersedia di SDP sebagai catalog

  • schema

    Jenis: string

    Nama skema default untuk pipa, di mana semua himpunan data dan metadata dalam skema default pipa diterbitkan secara default. Lihat Atur katalog target dan skema.

    Tersedia di SDP sebagai database, yang juga menerima alias schema

  • target (warisan)

    Jenis: string

    Nama skema default untuk pipa, di mana semua himpunan data dan metadata dalam skema default pipa diterbitkan secara default. Menggunakan schema alih-alih target lebih disukai.

    Hanya alur Lakeflow

  • storage (warisan)

    Jenis: string

    Lokasi di DBFS atau penyimpanan cloud tempat data output dan metadata yang diperlukan untuk eksekusi alur disimpan. Tabel dan metadata disimpan dalam subdirektori lokasi ini.

    storage Ketika pengaturan tidak ditentukan, sistem default ke lokasi di dbfs:/pipelines/.

    Pengaturan storage tidak dapat diubah setelah pipa saluran dibuat.

    Tersedia di SDP sebagai bidang yang diperlukan storage . Di alur Lakeflow, storage adalah pengaturan warisan

  • channel

    Jenis: string

    Versi runtime alur yang akan digunakan. Nilai yang didukung adalah:

    • preview untuk menguji alur Anda dengan perubahan yang akan datang pada versi runtime.
    • current untuk menggunakan versi runtime saat ini.

    Bidang channel bersifat opsional. Nilai defaultnya adalah current. Databricks merekomendasikan penggunaan versi runtime saat ini untuk beban kerja produksi.

    Hanya alur Lakeflow

  • edition

    Ketik string

    Edisi produk untuk menjalankan alur. Pengaturan ini memungkinkan Anda memilih edisi produk terbaik berdasarkan persyaratan alur Anda:

    • CORE untuk menjalankan beban kerja pengambilan data streaming.
    • PRO untuk menjalankan beban kerja ingestion streaming dan penangkapan perubahan data (CDC).
    • ADVANCED untuk menjalankan beban kerja penyerapan streaming, beban kerja CDC, dan beban kerja yang memerlukan harapan untuk memberlakukan batasan kualitas data.

    Bidang edition bersifat opsional. Nilai defaultnya adalah ADVANCED.

    Hanya alur Lakeflow

  • photon

    Jenis: boolean

    Sebuah indikator yang menunjukkan apakah akan menggunakan Apa itu Photon? untuk menjalankan pipeline. Photon adalah mesin Spark berperforma tinggi Azure Databricks. Saluran yang diaktifkan oleh Photon dikenai tarif yang berbeda dari saluran non-Photon.

    Bidang photon bersifat opsional. Nilai defaultnya adalah false.

    Hanya alur Lakeflow

  • serverless

    Jenis: boolean

    Bendera yang menunjukkan apakah alur menggunakan komputasi tanpa server. Lihat Mengonfigurasi alur tanpa server.

    Hanya alur Lakeflow

  • event_log

    Jenis: object

    Konfigurasi untuk tujuan log peristiwa alur, sebagai objek dengan namebidang , , catalogdan schema yang menerbitkan log peristiwa ke tabel Katalog Unity. Lihat Log peristiwa alur.

    Hanya alur Lakeflow

  • tags

    Jenis: object

    Peta opsional tag yang ditentukan pengguna untuk alur. Maksimal 25 tag dapat ditambahkan.

    Hanya alur Lakeflow

  • budget_policy_id

    Jenis: string

    ID kebijakan anggaran tanpa server untuk diterapkan ke alur ini, digunakan untuk mengaitkan penggunaan tanpa server untuk pelacakan biaya. Bidang ini muncul di konfigurasi JSON atau YAML hanya saat Anda secara eksplisit menetapkan kebijakan. Jika tidak diatur, Azure Databricks menyelesaikan kebijakan default secara otomatis. Kebijakan yang diselesaikan ditampilkan di antarmuka pengguna pengaturan alur, tetapi tidak ditulis ke konfigurasi JSON atau YAML.

    Hanya alur Lakeflow

  • root_path

    Jenis: string

    Jalur akar untuk alur. Ketika diatur, direktori ini ditambahkan ke sys.path saat menjalankan file sumber Python, sehingga modul dapat diimpor relatif terhadapnya.

    Hanya alur Lakeflow

  • environment

    Jenis: object

    Spesifikasi lingkungan yang digunakan untuk menginstal dependensi Python untuk alur.

    Hanya alur Lakeflow

  • pipelines.maxFlowRetryAttempts

    Jenis: int

    Jika kegagalan yang dapat diulang terjadi selama pembaruan alur, ini adalah jumlah maksimum kali untuk mencoba kembali alur sebelum gagal memperbarui alur.

    Gunakan ini untuk mengikat percobaan ulang pada satu alur yang rentan terhadap kegagalan yang dapat diulang sehingga tidak dapat menyimpan seluruh pembaruan.

    Default: Dua kali percobaan ulang. Ketika kegagalan yang dapat dicoba kembali terjadi, runtime alur mencoba menjalankan alur tiga kali, termasuk upaya asli.

    Hanya alur Lakeflow

  • pipelines.numUpdateRetryAttempts

    Jenis: int

    Jika kegagalan yang dapat diulang terjadi selama pembaruan, jumlah maksimum untuk mencoba kembali pembaruan sebelum pembaruan gagal secara permanen adalah sebagai berikut. Upaya ulang dilakukan sebagai pembaruan penuh.

    Gunakan ini untuk mengikat percobaan ulang pada seluruh pembaruan, sehingga pembaruan yang macet gagal secara permanen daripada mencoba kembali tanpa batas waktu.

    Parameter ini hanya berlaku untuk alur menggunakan perilaku coba lagi dan mulai ulang otomatis. Percobaan ulang tidak dicoba untuk pembaruan ad-hoc yang dijalankan dari editor atau saat Anda menjalankan Validate pembaruan.

    Default:

    • Lima untuk pipeline yang dipicu.
    • Tidak terbatas untuk alur berkelanjutan.

    Hanya alur Lakeflow

Properti tabel alur

Selain properti tabel yang didukung oleh Delta Lake, Anda bisa mengatur properti tabel berikut ini.

  • pipelines.autoOptimize.zOrderCols

    Standar: Tidak ada

    String opsional yang berisi daftar nama kolom yang dipisahkan dengan koma untuk mengurutkan tabel ini dengan z-order. Misalnya: pipelines.autoOptimize.zOrderCols = "year,month"

    Databricks merekomendasikan pengklusteran cair alih-alih pemesanan Z untuk mengoptimalkan tata letak data dalam tabel alur. Untuk membiarkan Databricks memilih dan memelihara kolom pengklusteran secara otomatis, gunakan CLUSTER BY AUTO (cluster_by_auto=True dalam Python). Lihat Menggunakan pengklusteran cair untuk tabel.

    Hanya alur Lakeflow

  • pipelines.reset.allowed

    Standar: true

    Mengontrol apakah refresh penuh diizinkan untuk tabel ini.

    Tersedia di SDP sebagai pipelines.reset.allowed

  • pipelines.autoOptimize.managed

    Standar: true

    Mengaktifkan atau menonaktifkan pengoptimalan terjadwal tabel ini secara otomatis.

    Untuk alur yang dikelola oleh pengoptimalan prediktif, properti ini tidak digunakan.

    Hanya alur Lakeflow

Interval pemicu jalur kerja

Anda dapat menentukan interval pemicu alur untuk seluruh alur atau sebagai bagian dari deklarasi himpunan data. Silakan lihat Menetapkan interval pemicu untuk alur pipa berkelanjutan.

  • pipelines.trigger.interval

    Pengaturan bawaan didasarkan pada jenis alur.

    • Lima detik untuk kueri streaming.
    • Satu menit untuk kueri lengkap saat semua data input berasal dari sumber Delta.
    • Diperlukan sepuluh menit untuk kueri lengkap ketika beberapa sumber data mungkin bukan Delta.

    Nilainya adalah angka ditambah unit waktu. Berikut ini adalah unit waktu yang valid:

    • second, seconds
    • minute, minutes
    • hour, hours
    • day, days

    Anda dapat menggunakan unit tunggal atau jamak saat menentukan nilai, misalnya:

    • {"pipelines.trigger.interval" : "1 hour"}
    • {"pipelines.trigger.interval" : "10 seconds"}
    • {"pipelines.trigger.interval" : "30 second"}
    • {"pipelines.trigger.interval" : "1 minute"}
    • {"pipelines.trigger.interval" : "10 minutes"}
    • {"pipelines.trigger.interval" : "10 minute"}

    Hanya alur Lakeflow

Atribut kluster yang tidak dapat diatur pengguna

Karena alur mengelola siklus hidup kluster, banyak pengaturan kluster diatur oleh sistem dan tidak dapat dikonfigurasi secara manual oleh pengguna, baik dalam konfigurasi alur atau dalam kebijakan kluster yang digunakan oleh alur. Tabel berikut mencantumkan pengaturan ini dan mengapa tidak dapat diatur secara manual.

Hanya alur Lakeflow. SDP tidak mengelola komputasi, sehingga atribut kluster ini tidak berlaku

  • cluster_name

    SDP menetapkan nama kluster yang digunakan untuk menjalankan pembaruan alur. Nama-nama ini tidak dapat digantikan.

  • data_security_mode

    access_mode

    Nilai-nilai ini secara otomatis diatur oleh sistem.

  • spark_version

    Kluster SDP berjalan pada versi kustom Databricks Runtime yang terus diperbarui untuk menyertakan fitur terbaru. Versi Spark sudah dibundel dengan versi Databricks Runtime dan tidak dapat diubah.

  • autotermination_minutes

    Karena SDP mengelola penghentian otomatis kluster dan logika penggunaan kembali, waktu penghentian otomatis kluster tidak dapat diubah.

  • runtime_engine

    Meskipun Anda dapat mengontrol bidang ini dengan mengaktifkan Photon untuk alur Anda, Anda tidak dapat mengatur nilai ini secara langsung.

  • effective_spark_version

    Nilai ini secara otomatis diatur oleh sistem.

  • cluster_source

    Bidang ini diatur oleh sistem dan hanya bisa dibaca.

  • docker_image

    Karena SDP mengelola siklus hidup kluster, Anda tidak dapat menggunakan kontainer kustom dengan kluster alur.

  • workload_type

    Nilai ini diatur oleh sistem dan tidak dapat digantikan.

Opsi sumber dan kueri

Beberapa perilaku penyerapan dan pemrosesan data dikonfigurasi pada sumber data atau kueri daripada sebagai properti alur. Ini termasuk evolusi skema, petunjuk dan inferensi skema, batas laju penyerapan, dan pemfilteran file. Untuk mengonfigurasinya, gunakan opsi untuk read_files dan Auto Loader. Untuk evolusi skema dengan from_json, lihat Menyimpulkan dan mengembangkan skema menggunakan from_json dalam alur.