Perencanaan kapasitas untuk kluster HDInsight

Sebelum menyebarkan kluster HDInsight, rencanakan kapasitas kluster yang dimaksudkan dengan menentukan performa dan skala yang diperlukan. Perencanaan ini membantu mengoptimalkan kegunaan dan biaya. Beberapa keputusan kapasitas kluster tidak dapat diubah setelah penyebaran. Jika parameter performa berubah, kluster dapat dibongkar dan dibuat ulang tanpa kehilangan data yang disimpan.

Pertanyaan utama yang diajukan untuk perencanaan kapasitas adalah:

  • Di wilayah geografis mana Anda harus menyebarkan kluster Anda?
  • Berapa banyak penyimpanan yang Anda butuhkan?
  • Jenis kluster apa yang harus Anda sebarkan?
  • Ukuran dan jenis komputer virtual (VM) apa yang harus digunakan node kluster Anda?
  • Berapa banyak simpul pekerja yang harus dimiliki kluster Anda?

Pilih wilayah Azure

Wilayah Azure menentukan di mana kluster Anda disediakan secara fisik. Untuk meminimalkan latensi baca dan tulis, kluster harus berada di dekat data Anda.

HDInsight tersedia di banyak wilayah Azure. Untuk menemukan wilayah terdekat, lihat Produk yang tersedia menurut wilayah.

Pilih lokasi dan ukuran penyimpanan

Lokasi penyimpanan default

Penyimpanan default, baik akun Azure Storage atau Azure Data Lake Storage, harus berada di lokasi yang sama dengan kluster Anda. Azure Storage tersedia di semua lokasi. Data Lake Storage tersedia di beberapa wilayah - lihat ketersediaan Data Lake Storage saat ini.

Lokasi data yang ada

Jika Anda ingin menggunakan akun penyimpanan yang ada atau Data Lake Storage sebagai penyimpanan default kluster Anda, maka Anda harus menyebarkan kluster anda di lokasi yang sama.

Ukuran penyimpanan

Pada kluster yang disebarkan, Anda dapat melampirkan akun Azure Storage lain atau mengakses Data Lake Storage lainnya. Semua akun penyimpanan Anda harus tinggal di lokasi yang sama dengan kluster Anda. Data Lake Storage dapat berada di lokasi yang berbeda, meskipun jarak yang jauh dapat memperkenalkan beberapa latensi.

Azure Storage memiliki beberapa batas kapasitas, sementara Data Lake Storage hampir tidak terbatas. Kluster dapat mengakses kombinasi akun penyimpanan yang berbeda. Contoh umumnya meliputi:

  • Ketika jumlah data kemungkinan melebihi kapasitas penyimpanan satu kontainer penyimpanan blob.
  • Ketika tingkat akses ke kontainer blob mungkin melebihi ambang batas tempat pembatasan terjadi.
  • Saat ingin membuat data, Anda telah mengunggah ke kontainer blob yang tersedia untuk kluster.
  • Ketika Anda ingin mengisolasi berbagai bagian penyimpanan karena alasan keamanan, atau untuk menyederhanakan administrasi.

Untuk performa yang lebih baik, gunakan hanya satu kontainer per akun penyimpanan.

Pilih jenis kluster

Jenis kluster menentukan pekerjaan yang dapat dijalankan oleh kluster HDInsight Anda. Jenisnya termasuk Apache Hadoop, Apache Kafka, atau Apache Spark. Untuk deskripsi terperinci tentang jenis kluster yang tersedia, lihat Pengenalan Azure HDInsight. Setiap jenis kluster memiliki topologi penyebaran tertentu yang mencakup persyaratan untuk ukuran dan jumlah simpul.

Pilih ukuran dan jenis VM

Setiap jenis kluster memiliki sekumpulan jenis node, dan setiap jenis node memiliki opsi khusus untuk ukuran dan jenis VM mereka.

Untuk menentukan ukuran kluster optimal untuk aplikasi Anda, Anda dapat tolok ukur kapasitas kluster dan meningkatkan ukuran seperti yang ditunjukkan. Misalnya, Anda dapat menggunakan beban kerja yang disimulasikan, atau canary query. Jalankan beban kerja simulasi Anda pada kluster ukuran yang berbeda. Secara bertahap meningkatkan ukuran hingga performa yang dimaksud tercapai. Kueri kenari dapat disisipkan secara berkala di antara kueri produksi lainnya untuk menunjukkan apakah kluster memiliki sumber daya yang cukup.

Untuk informasi selengkapnya tentang cara memilih keluarga VM yang tepat untuk beban kerja Anda, lihat Memilih ukuran VM yang tepat untuk kluster Anda.

Pilih skala kluster

Skala kluster ditentukan oleh kuantitas simpul VM-nya. Untuk semua jenis kluster, ada jenis node yang memiliki skala tertentu, dan jenis node yang mendukung peluasan skala. Misalnya, kluster mungkin memerlukan tepat tiga node Apache ZooKeeper atau dua node Head. Node pekerja yang melakukan pemrosesan data secara terdistribusi mendapatkan manfaat dari node pekerja lain.

Tergantung pada jenis kluster Anda, meningkatkan jumlah simpul pekerja menambahkan lebih banyak kapasitas komputasi (seperti lebih banyak inti). Lebih banyak simpul akan meningkatkan total memori yang diperlukan bagi seluruh kluster untuk mendukung penyimpanan data dalam memori yang sedang diproses. Seperti halnya pilihan ukuran dan jenis VM, memilih skala kluster yang tepat biasanya tercapai secara empirik. Gunakan beban kerja yang disimulasikan atau kueri kenari.

Anda dapat meluaskan skala kluster Anda untuk memenuhi permintaan beban puncak. Kemudian turunkan skalanya kembali ketika simpul tambahan tersebut tidak lagi diperlukan. Fitur Autoscale memungkinkan Anda menskalakan kluster secara otomatis berdasarkan metrik dan waktu yang telah ditentukan. Untuk informasi selengkapnya tentang penskalaan kluster Anda secara manual, lihat Menskalakan kluster HDInsight.

Siklus hidup kluster

Anda dikenakan biaya untuk masa pakai kluster. Jika hanya ada waktu tertentu yang Anda butuhkan untuk kluster Anda, buat kluster sesuai permintaan menggunakan Azure Data Factory. Anda juga dapat membuat skrip PowerShell yang menyediakan dan menghapus kluster Anda, lalu menjadwalkan skrip tersebut menggunakan Azure Automation.

Nota

Saat kluster dihapus, metastore Apache Hive defaultnya juga dihapus. Untuk mempertahankan metastore untuk pembuatan ulang kluster berikutnya, gunakan penyimpanan metadata eksternal seperti Azure Database atau Apache Oozie.

Mengisolasi kesalahan tugas klaster

Terkadang kesalahan dapat terjadi karena eksekusi paralel beberapa peta dan mengurangi komponen pada kluster multi-simpul. Untuk membantu mengisolasi masalah, coba uji terdistribusi. Jalankan beberapa tugas secara bersamaan di kluster simpul kerja tunggal. Kemudian perluas pendekatan ini untuk menjalankan beberapa pekerjaan secara bersamaan pada kluster yang berisi lebih dari satu simpul. Untuk membuat kluster HDInsight simpul tunggal di Azure, gunakan opsi Custom(size, settings, apps) dan gunakan nilai 1 untuk Jumlah simpul Pekerja di bagian Ukuran kluster ketika menyiapkan kluster baru di portal.

Lihat manajemen kuota untuk HDInsight

Lihat tingkat granular dan kategorisasi kuota pada tingkat keluarga VM. Lihat kuota saat ini dan berapa banyak kuota yang tersisa untuk suatu wilayah di tingkat keluarga VM.

Nota

Fitur ini saat ini tersedia di HDInsight 4.x dan 5.x untuk wilayah EUAP US Timur. Wilayah lain untuk diikuti kemudian.

  1. Lihat kuota saat ini:

    Lihat kuota saat ini dan berapa banyak kuota yang tersisa untuk suatu wilayah di tingkat keluarga VM.

    1. Dari portal Microsoft Azure, di bilah pencarian atas, cari dan pilih Kuota.

    2. Dari halaman Kuota, pilih Azure HDInsight

      Cuplikan layar memperlihatkan cara mencari kuota.

    3. Dari kotak dropdown, pilih Langganan dan Wilayah Anda

      Cuplikan layar memperlihatkan cara memilih kluster dan wilayah untuk alokasi kuota.

      Cuplikan layar memperlihatkan cara menampilkan dan mengelola kuota.

  2. Meminta kuota baru per keluarga dan wilayah VM

    1. Klik baris yang ingin Anda lihat detail kuotanya.

    Cuplikan layar memperlihatkan detail kuota.

Kuota

Untuk informasi selengkapnya tentang mengelola kuota langganan, lihat Meminta penambahan kuota.

Langkah berikutnya