Keandalan dalam Azure

Di lingkungan cloud, kegagalan tidak dapat dihindari. Kesalahan perangkat keras, cacat perangkat lunak, kesalahan konfigurasi, lonjakan lalu lintas, pemadaman pusat data, dan bahkan pemadaman di seluruh wilayah dapat terjadi. Keandalan adalah kemampuan beban kerja untuk tetap memenuhi ekspektasi bisnis, bahkan selama kegagalan atau gangguan. Dengan arsitektur dan operasi yang tepat, kegagalan tidak perlu mengakibatkan waktu henti.

Waktu henti yang tidak dienkripsi dapat berdampak besar. Ini membawa biaya keuangan dan merusak kepercayaan pelanggan dan pengguna. Di luar dampak langsung ini, keandalan yang buruk memengaruhi kewajiban kepatuhan dan posisi yang kompetitif. Tim Anda menghabiskan lebih banyak waktu untuk pemadam kebakaran dan lebih sedikit waktu untuk memberikan nilai. Ini bahkan dapat memicu penalti tingkat layanan kontraktual.

Azure menyediakan infrastruktur tangguh dan layanan terkelola, tetapi keandalan beban kerja Anda tergantung pada keputusan desain dan operasional yang Anda buat: bagaimana Anda merancang arsitektur, mengonfigurasi layanan, mengelola dependensi, mengotomatiskan respons terhadap masalah, dan menguji perangkat lunak dan proses. Merancang untuk keandalan lebih awal membantu Anda meminimalkan kegagalan dan memastikan bahwa, ketika itu terjadi, beban kerja Anda menurun dengan cara yang dapat diprediksi dan dikontrol yang selaras dengan prioritas bisnis.

Beban kerja yang andal memiliki dua properti penting:

  • Ini tangguh, yang berarti dapat menyerap kegagalan dan perubahan lingkungan sambil terus beroperasi pada tingkat layanan yang dapat diterima.
  • Ini juga dapat dipulihkan, yang berarti bahwa ketika gangguan terjadi, beban kerja dapat memulihkan operasi normal dalam waktu yang ditentukan dan batas kehilangan data.

Anda memerlukan kedua properti untuk memenuhi harapan ketersediaan dunia nyata dan menjaga kelangsungan bisnis.

Keandalan dalam Azure berfungsi di tiga lapisan yang saling terhubung:

  • Aplikasi Anda: Pilihan, praktik, dan proses arsitektur Anda, termasuk manajemen dependensi, runbook, otomatisasi, dan pengujian
  • Fitur keandalan, termasuk:
    • Layanan dan konfigurasi beban kerja: Cara Anda mengonfigurasi layanan Azure yang menjalankan beban kerja Anda, dan kemampuan keandalan yang Anda konfigurasi dalam layanan tersebut
    • Azure layanan platform: Azure layanan yang secara khusus mendukung keandalan beban kerja, seperti penyeimbangan beban, DNS, perutean lalu lintas, dan pemantauan
  • Fondasi keandalan: Azure ketahanan bawaan, seperti zona ketersediaan, wilayah, dan praktik penyebaran yang aman

Lapisan-lapisan ini bekerja sama untuk menentukan keandalan beban kerja secara keseluruhan. Memahaminya membantu Anda membedakan antara apa yang Azure berikan secara default dan apa yang Anda butuhkan untuk merancang, mengonfigurasi, dan mengoperasikan.

Model ini membantu Anda memanfaatkan apa yang Azure berikan sambil bertanggung jawab atas apa yang hanya dapat Anda desain. Artikel ini berfokus pada apa yang Azure sediakan di seluruh lapisan ini. Untuk panduan komprehensif tentang desain beban kerja dan lapisan operasi (merancang solusi tangguh dan pola arsitektur), lihat Azure Well-Architected Framework dan terutama pilar keandalan.

Tanggung jawab bersama untuk keandalan

Keandalan dalam Azure mengikuti model tanggung jawab bersama. Microsoft menyediakan platform tangguh melalui Azure. Anda merancang beban kerja yang tangguh.

Diagram memperlihatkan lapisan keandalan dalam Azure.

  • Microsoft memiliki fondasi platform dan layanan keandalan platform. Kepemilikan ini mencakup infrastruktur tangguh (redundansi fisik, isolasi kesalahan, dan penyembuhan), zona ketersediaan, distribusi regional, praktik penyebaran yang aman, dan layanan tingkat platform seperti penyeimbangan beban, perutean lalu lintas, dan pemantauan. Microsoft bertanggung jawab atas keandalan platform Azure, dan untuk keandalan layanan seperti yang didefinisikan oleh SLA dan dokumentasi yang diterbitkan setiap layanan seperti panduan keandalan mereka.

  • Anda memiliki desain dan operasi beban kerja. Anda bertanggung jawab untuk menerjemahkan kemampuan Azure ke dalam perilaku beban kerja yang andal melalui keputusan arsitektur, pilihan konfigurasi, praktik operasional, dan pengujian.

    Azure tidak dapat mengetahui target ketersediaan Anda, tradeoff yang dapat diterima, konteks bisnis, atau persyaratan khusus aplikasi. Hanya Anda yang dapat menentukan persyaratan dan desain tersebut yang sesuai. Azure menyediakan kemampuan, saat Anda memilih dan mengonfigurasinya. Misalnya, Anda mengonfigurasi perilaku failover untuk layanan seperti database, dan Anda menentukan pemeriksaan kesehatan load balancer yang secara akurat mewakili kesehatan aplikasi sehingga keputusan perutean lalu lintas benar, bahkan selama kegagalan.

    Important

    Platform ini menyediakan blok penyusun, bukan jaminan end-to-end. Pilihan desain dan operasional Anda menentukan apakah kemampuan tersebut diterjemahkan ke dalam beban kerja yang andal. Untuk perincian lengkap model tanggung jawab bersama, lihat Tanggung jawab bersama di cloud.

Perjanjian tingkat layanan (SLA) menentukan komitmen dan harapan keandalan di seluruh layanan Azure. Memahami SLA sangat penting saat mengevaluasi layanan dan merancang untuk target ketersediaan tertentu. Azure layanan menerbitkan komitmen SLA yang dapat bervariasi menurut tingkat konfigurasi dan redundansi. Layanan lain yang Anda gunakan dari penyedia lain mungkin juga menerbitkan SLA. Untuk panduan komprehensif tentang cara kerja SLA dan terkait dengan harapan ketersediaan beban kerja Anda, lihat Perjanjian tingkat layanan.

Fondasi tangguh di Azure

Azure dirancang dengan beberapa lapisan ketahanan yang dibangun ke dalam platform itu sendiri. Fondasi ini memberikan kemampuan dasar di mana beban kerja yang andal dibangun:

  • Ketahanan infrastruktur fisik: Azure pusat data dirancang dengan infrastruktur redundan seperti daya, pendinginan, dan konektivitas jaringan. Pengontrol fabric Azure secara otomatis mengisolasi dan mengelola kegagalan perangkat keras. Ini mendeteksi kesalahan dan mengatur migrasi beban kerja ke perangkat keras yang sehat tanpa intervensi pelanggan.

  • Wilayah: Azure beroperasi di lebih dari 70 wilayah di seluruh dunia. Distribusi geografis ini memungkinkan beban kerja untuk menahan gangguan dan pemadaman di seluruh wilayah melalui kemampuan failover yang direncanakan, sambil mengikuti persyaratan residensi data Anda. Untuk informasi selengkapnya, lihat ringkasan wilayah Azure.

  • Zona ketersediaan: Banyak wilayah Azure mencakup pusat data yang terpisah secara fisik dalam wilayah yang sama. Zona ketersediaan ini terhubung oleh jaringan latensi rendah berkecepatan tinggi. Setiap zona memiliki daya, pendinginan, dan jaringan independen untuk melindungi dari kegagalan tingkat pusat data sambil mempertahankan kemampuan replikasi sinkron untuk banyak layanan Azure. Untuk informasi selengkapnya, lihat Apa itu zona ketersediaan?

  • Penyebaran yang aman: Azure menerapkan proses penyebaran yang terkontrol dan terhuyung untuk pembaruan platform dan perubahan layanan untuk meminimalkan risiko gangguan layanan yang meluas. Platform meluncurkan pembaruan secara bertahap, seperti di seluruh domain kesalahan, zona ketersediaan, dan wilayah, dengan kemampuan putar kembali otomatis saat mendeteksi masalah. Pendekatan ini memastikan bahwa perubahan platform tidak menimbulkan risiko keandalan pada beban kerja pelanggan.

Azure menyediakan fondasi tingkat platform ini secara otomatis. Mereka membentuk lapisan dasar tempat Anda membangun beban kerja yang andal. Namun, Anda masih harus mengonfigurasi layanan dengan benar dan menggabungkan kemampuan ini dengan cara yang memenuhi persyaratan bisnis spesifik Anda.

Azure layanan yang mendukung keandalan Anda

Azure menyediakan kemampuan platform yang menerjemahkan konsep keandalan ke dalam blok penyusun yang dapat ditindaklanjuti untuk arsitektur Anda. Kemampuan ini bekerja sama untuk mengaktifkan arsitektur tangguh, dan banyak layanan Azure mencakup implementasi bawaan dari pola-pola ini:

Capability Description
Pengoptimalan keandalan yang didukung AI pengoptimalan keandalan yang didukung AI Menggunakan kemampuan berbasis AI untuk menilai dan meningkatkan keandalan. Kemampuan ini menganalisis pola beban kerja, mengidentifikasi potensi risiko, dan memberikan rekomendasi yang membantu tim berpindah dari pemecahan masalah reaktif ke manajemen keandalan proaktif. Kemampuan ini menampilkan sinyal keandalan dan menerjemahkannya ke dalam rekomendasi yang dapat ditindaklanjuti yang membantu tim memprioritaskan dan meningkatkan keandalan dari waktu ke waktu.

Azure menyediakan beberapa layanan keandalan berbasis AI, termasuk:
- kemampuan ketahanan Azure
- Kemampuan ketahanan dalam Agen (pratinjau) di Azure Copilot
- Agen SRE Azure

Layanan ini menganalisis pola beban kerja dan menyarankan peningkatan untuk mengoptimalkan postur keandalan Anda di seluruh papan.
Penyeimbangan beban dan manajemen lalu lintas Penyeimbangan beban dan manajemen lalu lintas Memungkinkan keandalan dengan merutekan lalu lintas antara instans redundan dan menangani failover secara otomatis. Kemampuan ini sangat penting untuk mempertahankan ketersediaan layanan ketika komponen individual gagal.

Azure menyediakan penyeimbangan beban pada beberapa lapisan, termasuk:
- Azure Load Balancer untuk distribusi lalu lintas TCP/UDP Layer-4
- Azure Application Gateway untuk perutean HTTP Layer-7 dengan pemeriksaan kesehatan sadar aplikasi
- Azure Front Door untuk penyeimbangan beban HTTP global dengan failover cepat
- Azure Traffic Manager untuk distribusi titik akhir global berbasis DNS

Jika Anda memerlukan bantuan untuk memutuskan load balancer mana yang akan digunakan untuk skenario Anda, lihat Opsi penyeimbangan beban.
Pencadangan dan perlindungan data Pencadangan dan perlindungan data Perlindungan terhadap kehilangan data dan kerusakan, dan memungkinkan pemulihan setelah masalah terjadi.

Azure menyediakan beberapa kemampuan pencadangan dan pemulihan, termasuk:
- Azure Backup untuk pencadangan terpusat dengan retensi yang dapat dikonfigurasi untuk komputer virtual, kontainer blob, file, dan beberapa database
- Fitur pencadangan dan pemulihan asli di banyak layanan Azure, termasuk sebagian besar layanan database
- Bicep dan infrastruktur lainnya sebagai alat kode untuk pencadangan konfigurasi, perlindungan penyimpangan, dan rekreasi lingkungan yang cepat

Tinjau setiap panduan keandalan layanan Azure untuk memahami pendekatan cadangan yang didukung layanan.
Replikasi geografis dan failover Replikasi geografis dan failover Memungkinkan pemulihan dari kegagalan regional melalui replikasi data lintas wilayah dan kemampuan failover otomatis.

Azure Site Recovery mengatur pemulihan bencana untuk beban kerja komputer virtual dengan pengurutan replikasi dan failover otomatis. Banyak layanan Azure juga menyediakan fitur replikasi geografis bawaan, termasuk:
- Azure Cosmos DB dengan replikasi data lintas wilayah asli dan kemampuan failover
- Azure API Management dengan kemampuan failover lintas wilayah asli

Panduan keandalan layanan merinci opsi replikasi geografis apa pun yang tersedia untuk setiap layanan.
Pemantauan dan pengamatan pengamatan dan pengamatan Memberikan visibilitas komprehensif ke dalam postur keandalan dan memungkinkan respons proaktif terhadap masalah.

Azure menyediakan beberapa layanan pengamatan, termasuk:
- Azure Monitor dan Application Insights untuk pemantauan, peringatan, dan pelacakan dependensi real time
- Model kesehatan dalam Azure Monitor untuk memantau kesehatan seluruh beban kerja
- Azure Service Health untuk pemberitahuan dan panduan yang dipersonalisasi untuk masalah layanan Azure yang dapat memengaruhi beban kerja Anda

Bersama-sama, kemampuan ini membantu Anda memahami apakah Anda memenuhi persyaratan keandalan dan merespons dengan cepat saat masalah muncul.
Pengujian dan validasi keandalan pengujian dan validasi keandalan Membantu memverifikasi bahwa beban kerja berulah seperti yang diharapkan dalam kondisi kegagalan dan membantu memastikan solusi Anda memenuhi persyaratan keandalan sebelum masalah memengaruhi pengguna.

Azure menyediakan layanan pengujian keandalan, termasuk:
- Azure Chaos Studio eksperimen injeksi kesalahan terkontrol untuk memvalidasi perilaku penyembuhan diri dan ketahanan terhadap kegagalan dunia nyata
- Pengujian Aplikasi Azure untuk pengujian performa dan fungsi untuk memahami perilaku aplikasi, termasuk di bawah tekanan

Mengaktifkan keandalan dalam layanan Azure

Platform ini menyediakan kemampuan keandalan lapisan layanan melalui puluhan layanan Azure, masing-masing dengan kekuatan dan kasus penggunaan tertentu. Panduan keandalan setiap layanan memberikan detail tentang bagaimana layanan dapat tetap tersedia selama skenario yang berbeda, misalnya:

  • Kesalahan sementara, yang merupakan kegagalan terputus-putus singkat. Panduan layanan memberikan rekomendasi untuk praktik terbaik guna meminimalkan dampaknya, seperti mencoba kembali dan menggunakan SDK yang disediakan Microsoft.
  • Kegagalan zona ketersediaan, sehingga layanan dapat secara otomatis mengalihkan permintaan untuk menjaga ketersediaan tinggi.
  • Kegagalan di seluruh wilayah, sehingga layanan dapat gagal ke wilayah sekunder dan terus beroperasi selama gangguan wilayah.

Untuk melihat panduan keandalan untuk banyak layanan Azure, lihat Panduan keandalan berdasarkan layanan.

Merancang beban kerja yang andal

Keandalan muncul dari siklus berkelanjutan yang menentukan target, merancang kegagalan dan pemulihan cepat, menguji asumsi, dan meningkatkan melalui pembelajaran operasional. Gunakan panduan Azure Well-Architected Framework dan keandalan layanan untuk memahami apa yang disediakan setiap layanan secara default dan apa yang memerlukan konfigurasi eksplisit. Untuk pendekatan terstruktur dalam menerapkan keandalan, lihat model kematangan keandalan Azure Well-Architected Framework.

Saat Anda merancang, hubungkan konsep dasar dengan konsep teknis. Konsep dasar seperti kelangsungan bisnis dan tanggung jawab bersama menentukan hasil apa yang perlu Anda capai. Konsep teknis seperti redundansi, replikasi, pencadangan, failover, dan failback menentukan bagaimana Anda menerapkan hasil tersebut dalam arsitektur dan operasi Anda. Perjanjian tingkat layanan membantu Anda memahami jaminan yang Anda terima dari penyedia layanan Anda.

Kedaulatan dan residensi data

Saat Anda merancang keandalan, sertakan persyaratan kedaulatan dan residensi data lebih awal karena memengaruhi pemilihan wilayah, strategi replikasi, dan jalur failover. Arsitektur yang tangguh masih dapat gagal memenuhi persyaratan kepatuhan jika failover atau perpindahan data melintasi batasan yang dibatasi. Untuk informasi selengkapnya, lihat Keandalan dan kedaulatan.

Keandalan dalam Azure dicapai dengan menggabungkan fondasi platform tangguh dengan desain dan operasi beban kerja yang bijaksana. Dengan memahami apa yang disediakan Azure dan di mana Anda perlu membuat keputusan desain dan konfigurasi, Anda dapat membangun sistem yang terus memenuhi harapan bisnis, bahkan jika terjadi kegagalan.