Memindahkan file persiapan data visual ke produksi

Setiap file persiapan data visual yang Anda buat di Lakeflow Designer didukung oleh kode siap produksi dan disimpan sebagai buku catatan bernama <name>.designer.ipynb. Anda dapat memindahkannya ke produksi dengan alat yang sama dengan yang Anda gunakan untuk kode Azure Databricks lainnya: menyimpannya di Git, menjalankannya sebagai pekerjaan, dan menyebarkannya dengan Bundel Otomatisasi Deklaratif.

Halaman ini menjelaskan cara mengambil file persiapan data visual dari prototipe ke produksi.

Simpan dan versi di Git

Ruang kerja menyimpan file persiapan data visual secara asli. Untuk membuat versi file persiapan data visual, letakkan di folder Git dan lacak seperti buku catatan lainnya:

  1. Buat folder Git di ruang kerja Anda.
  2. Pindahkan file persiapan data visual ke folder Git tersebut.
  3. Lacak, terapkan, dan versi file seperti notebook lainnya di Git. Di Git, file muncul sebagai <file_name>.designer.ipynb.

Untuk informasi selengkapnya tentang folder Git, lihat folder Git Azure Databricks. Untuk mengekspor atau mengimpor file persiapan data visual, lihat Mengekspor dan mengimpor file persiapan data visual.

Jadwalkan sebagai tugas

Anda dapat mengotomatiskan file persiapan data visual dengan menjadwalkannya sebagai pekerjaan.

  • Jadwalkan secara langsung: Klik tombol Jadwalkan di menu atas untuk membuat pekerjaan terjadwal untuk file persiapan data visual Anda.
  • Tambahkan ke pekerjaan: Buat pekerjaan Azure Databricks dan tambahkan file persiapan data visual Anda sebagai tugas. Ini memungkinkan Anda menggabungkan file persiapan data visual tersebut dengan tugas lain dalam alur yang lebih besar. Di menu drop-down Jenis tugas, pilih Persiapan data visual, lalu pilih file.

Eksekusi terjadwal menampilkan setiap operator sebagai simpul tersendiri dalam grafik tugas Jobs, sehingga Anda dapat memeriksa hasil setiap operator dalam suatu eksekusi sama seperti di kanvas.

Untuk melihat dan mengelola jadwal yang ada, klik Jadwalkan lagi untuk membuka daftar. Klik Tambahkan jadwal untuk membuat jadwal lain, atau buka ikon menu Kebab jadwal. menu kebab untuk Mengedit, Menjalankan sekarang, Menjeda, Mengkloning, Menampilkan dalam Pekerjaan, atau Menghapusnya .

Menampilkan output operator dalam eksekusi

Secara default, eksekusi terjadwal menghasilkan output hanya untuk operator terminal (operator tanpa koneksi hilir), seperti operator Output. Untuk melihat hasil setiap operator dalam eksekusi, perluas Pengaturan tingkat lanjut dalam dialog jadwal dan pilih Tampilkan output operator.

Kontrol penjadwalan LFD untuk mengotomatiskan file persiapan data visual sebagai tugas.

Nonaktifkan opsi ini untuk kanvas besar untuk menghindari melebihi batas ukuran output eksekusi.

Pilih lingkungan tanpa server

Saat bekerja dengan file persiapan data visual, Anda dapat memilih lingkungan tanpa server yang digunakan untuk eksekusi interaktif dan pekerjaan terjadwal. Konfigurasikan dari ikon Lingkungan.Panel sisi lingkungan di bilah sisi kanan, cara yang sama seperti yang Anda lakukan untuk buku catatan. Di bawah Lingkungan dasar, pilih versi lingkungan. Lihat Mengonfigurasi lingkungan tanpa server.

Membuat parameter di seluruh lingkungan

Parameter diberi nama nilai yang ditentukan untuk file persiapan data visual secara keseluruhan yang dapat Anda referensikan dari operator SQL dan Python. Untuk detail tentang menentukan dan mereferensikan parameter, lihat Parameter.

Parameter memungkinkan Anda menjalankan file persiapan data visual yang sama terhadap lingkungan yang berbeda, misalnya, katalog pengujian selama pengembangan dan katalog produksi dalam produksi.

  • Saat Anda menjadwalkan pekerjaan di UI: Ambil alih nilai parameter untuk setiap jadwal. Misalnya, buat satu jadwal yang berjalan dengan parameter environment yang diatur ke test, dan jadwal lainnya yang berjalan dengan parameter tersebut diatur ke production.
  • Saat Anda menyebarkan dengan bundel: Atur nilai parameter melalui pekerjaan parameters, dan gunakan target bundel untuk menyediakan nilai yang berbeda per lingkungan. Target pengembangan dan produksi untuk bundle memungkinkan Anda menyebarkan job yang sama ke lingkungan yang terpisah dengan pengaturan khusus untuk tiap lingkungan. Lihat Mode penyebaran Bundel Otomatisasi Deklaratif dan konfigurasi Bundel Otomatisasi Deklaratif.

Saat dijalankan, file persiapan data visual membaca parameternya dengan cara yang sama, baik dijalankan secara interaktif maupun sebagai job, sehingga file yang sama dapat berfungsi di seluruh lingkungan Anda tanpa perubahan.

Baca dari tabel yang berbeda untuk setiap lingkungan

Untuk membaca dari tabel sumber yang berbeda di setiap lingkungan, gunakan operator SQL dengan parameter alih-alih operator Sumber tetap. Tentukan catalogparameter , schema, dan table , lalu referensikan dengan IDENTIFIER() klausul untuk membangun nama tabel secara dinamis:

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Ganti parameter catalog, schema, atau table untuk setiap jadwal atau target bundel agar file persiapan data visual yang sama menggunakan data uji selama pengembangan dan data produksi di lingkungan produksi. Untuk informasi selengkapnya tentang IDENTIFIER() klausa, lihat IDENTIFIER klausa.

Menyebarkan dengan Bundel Otomatisasi Deklaratif

Bundel Otomatisasi Deklaratif memungkinkan Anda menentukan dan menerapkan sumber daya Azure Databricks seperti job dalam bentuk file sumber, sehingga Anda dapat menerapkan praktik terbaik rekayasa perangkat lunak seperti kontrol versi, peninjauan kode, pengujian, dan CI/CD pada file persiapan data visual Anda. Lihat Apa itu Bundel Otomatisasi Deklaratif?.

Untuk menerapkan file penyiapan data visual dengan bundle, tentukan tugas notebook dan rujuk jalur file .designer.ipynb di notebook_task.notebook_path. Dalam bundel, file persiapan data visual menggunakan kunci notebook_task, meskipun UI Pekerjaan menampilkannya sebagai jenis tugas Persiapan data visual.

Contoh berikut mendefinisikan pekerjaan yang menjalankan file persiapan data visual yang terletak di samping file konfigurasi bundel:

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Sebarkan dan jalankan bundel dengan CLI Azure Databricks:

databricks bundle deploy
databricks bundle run daily_prep_job

Untuk kumpulan lengkap kunci tugas buku catatan, lihat Tugas buku catatan. Untuk panduan lengkap menentukan pekerjaan dalam bundel, lihat Mengembangkan pekerjaan dengan Bundel Automasi Deklaratif.

Otomatiskan dengan CI/CD

Untuk memvalidasi dan menyebarkan bundel persiapan data visual secara otomatis, integrasikan ke dalam alur CI/CD. Untuk contoh menggunakan GitHub Actions, lihat GitHub Actions.

Sumber daya tambahan