Pengaturan konfigurasi komputasi Spark di lingkungan Fabric

Pengalaman Microsoft Fabric Data Engineering dan Data Science beroperasi pada platform komputasi Spark yang dikelola sepenuhnya. Secara default, semua pekerjaan Spark di ruang kerja memiliki kumpulan dan pengaturan sumber daya yang sama, tetapi beban kerja yang berbeda sering memiliki persyaratan yang berbeda. Transformasi data ringan tidak memerlukan memori driver yang sama dengan pekerjaan pembelajaran mesin skala besar.

Lingkungan Fabric memungkinkan Anda menyesuaikan konfigurasi komputasi Spark per beban kerja, sehingga setiap notebook atau definisi pekerjaan Spark dapat berjalan dengan versi runtime, kumpulan, dan ukuran driver/eksekutor yang tepat tanpa mengubah default di seluruh ruang kerja.

Mengonfigurasi pengaturan komputasi tingkat ruang kerja

Admin ruang kerja mengontrol apakah item lingkungan dapat mengambil alih konfigurasi komputasi default ruang kerja. Menjaga kustomisasi tingkat item dinonaktifkan memastikan penggunaan sumber daya yang konsisten di seluruh ruang kerja. Mengaktifkannya memberi anggota dan kontributor fleksibilitas untuk menyetel komputasi untuk beban kerja individual.

  1. Di browser Anda, buka ruang kerja Fabric Anda di portal Fabric.

  2. Pilih Pengaturan ruang kerja.

  3. Pilih Rekayasa Data/Sains, lalu pilih Pengaturan Spark.

  4. Pilih tab Kumpulan .

  5. Aktifkan tombol Sesuaikan konfigurasi komputasi untuk item menjadi Aktif.

    Cuplikan layar yang memperlihatkan opsi kustomisasi komputasi tingkat item di pengaturan ruang kerja.

    Ketika tombol ini aktif, anggota dan kontributor dapat mengubah konfigurasi komputasi tingkat sesi di lingkungan Fabric. Saat nonaktif, bagian Komputasi dalam item lingkungan dinonaktifkan dan semua pekerjaan Spark menggunakan kumpulan default ruang kerja.

  6. Pilih Simpan.

Mengonfigurasi pengaturan komputasi pada lingkungan

Setelah admin ruang kerja mengaktifkan kustomisasi tingkat item, Anda dapat mengonfigurasi pengaturan komputasi di dalam item lingkungan. Ini termasuk memilih runtime Spark, memilih pool, dan menyetel sumber daya driver dan executor.

Pilih runtime Spark

  1. Buka item lingkungan Anda.

  2. Pada tab Beranda , pilih menu dropdown Runtime dan pilih versi runtime.

    Cuplikan layar memperlihatkan cara memilih versi runtime untuk lingkungan.

Setiap runtime Spark memiliki pengaturan defaultnya sendiri dan paket yang telah diinstal sebelumnya.

Penting

  • Perubahan runtime tidak berlaku sampai Anda menyimpan dan menerbitkan lingkungan.
  • Jika pustaka atau pengaturan komputasi yang ada tidak kompatibel dengan runtime yang dipilih, penerbitan gagal. Hapus atau perbarui pengaturan yang tidak kompatibel, lalu terbitkan lagi.
  • Untuk instruksi penerbitan langkah demi langkah, lihat Menyimpan dan menerbitkan perubahan.

Pilih kumpulan dan setel properti komputasi

  1. Buka lingkungan dan buka bagian Komputasi .

  2. Di bawah Kumpulan lingkungan, pilih kumpulan pemula atau kumpulan kustom yang dibuat oleh admin ruang kerja Anda.

    Cuplikan layar yang memperlihatkan tempat memilih kumpulan sumber daya di bagian Lingkungan Komputasi.

  3. Gunakan menu dropdown pada halaman Komputasi untuk mengonfigurasi properti Spark tingkat sesi untuk kumpulan yang dipilih. Nilai yang tersedia bergantung pada ukuran node kumpulan.

    Cuplikan layar yang memperlihatkan menu dropdown properti komputasi di bagian Komputasi lingkungan.

    Properti meliputi:

    • Inti driver Spark – Jumlah inti prosesor yang dialokasikan untuk driver Spark.
    • Memori driver Spark – Jumlah memori yang dialokasikan untuk driver Spark.
    • Inti pelaksana Spark – Jumlah inti yang dialokasikan untuk setiap pelaksana.
    • Memori pelaksana Spark – Jumlah memori yang dialokasikan untuk setiap pelaksana.

Untuk detail tentang ukuran kumpulan dan batas sumber daya yang tersedia, lihat Komputasi Spark di Fabric.

Nota

Properti Spark diatur melalui spark.conf.set parameter tingkat aplikasi kontrol dan tidak terkait dengan pengaturan komputasi lingkungan yang dijelaskan di sini.