Spolehlivost v Azure Disk Storage

Azure Disk Storage poskytuje spravované disky pro virtuální počítače Azure. Vytvořená pro důležité obchodní úlohy zajišťuje spolehlivost a dostupnost na podnikové úrovni. Vaše data se automaticky replikují, aby se ochránily před selháním hardwaru, s několika možnostmi redundance, aby splnily vaše požadavky na odolnost.

Při použití Azure je spolehlivost sdílenou odpovědností. Microsoft poskytuje řadu funkcí pro podporu odolnosti a obnovení. Zodpovídáte za pochopení toho, jak tyto možnosti fungují ve všech službách, které používáte, a výběrem možností, které potřebujete ke splnění vašich obchodních cílů a cílů dostupnosti.

Tento článek popisuje, jak zajistit odolnost služby Azure Disk Storage vůči různým potenciálním výpadkům a problémům, včetně přechodných chyb, selhání zón dostupnosti a selhání celé oblasti. Popisuje také možnosti zálohování a obnovení a zvýrazňuje klíčové informace o smlouvě o úrovni služeb (SLA) Azure Disk Storage.

Důležité

Při zvažování spolehlivosti disku je potřeba zvážit také spolehlivost virtuálních počítačů, síťové infrastruktury a aplikací, které běží na virtuálních počítačích. Zvýšení odolnosti samotného disku může mít omezený dopad, pokud ostatní komponenty nejsou stejně odolné. V závislosti na požadavcích na odolnost možná budete muset provést změny konfigurace v několika oblastech.

Doporučení pro nasazení do produkčního prostředí

Azure Well-Architected Framework poskytuje doporučení pro spolehlivost, výkon, zabezpečení, náklady a provoz. Pokud chcete zjistit, jak tyto oblasti vzájemně ovlivňují a přispívají k spolehlivému Azure Disk Storage řešení, přečtěte si osvědčené postupy Architecture pro Azure Disk Storage.

Přehled architektury spolehlivosti

Každý virtuální počítač používá disky pro různé účely:

  • Disk s operačním systémem: Na jednom disku s operačním systémem běží operační systém. Ve výchozím nastavení se jedná o spravovaný disk, který zachovává data. Můžete také použít dočasné disky s operačním systémem, které se nespravují. Nepoužívejte disk s operačním systémem k ukládání aplikací nebo dat.
  • Datové disky: Žádný nebo více spravovaných disků pro ukládání aplikací a dat.
  • Dočasný disk: Neperzistentní, nespravovaný disk, který je součástí každého virtuálního počítače.

Tato příručka se konkrétně zaměřuje na spravované disky, které spolehlivě uchovávají data. Další informace o různých rolích disků najdete v tématu Role disku.

Spravované disky jsou navrženy tak, aby zajišťovaly 99,999% dostupnost virtuálních počítačů, a poskytují alespoň 99,999999999 % (jedenáct devítek) odolnosti. Když používáte spravované disky, data se replikují třikrát. Pokud se jedna ze tří kopií stane nedostupnou, Azure automaticky vytvoří novou kopii dat na pozadí. Tento proces zajišťuje trvalost dat a vysokou odolnost proti chybám.

Spravované disky ve výchozím nastavení používají místně redundantní úložiště (LRS). LRS uchovává tři kopie dat disku v rámci jednoho datacentra, které chrání před selháním hardwaru, jako jsou problémy s jednotkami nebo serverovými racky.

I když LRS chrání vaše disky před selháním serverového racku a diskových jednotek, nechrání proti haváriím, jako je požár nebo záplava v datacentru. Pro vyšší úrovně ochrany použijte zónově redundantní úložiště (ZRS), které replikuje vaše disky napříč několika zónami dostupnosti.

U aplikací, které běží na více virtuálních počítačích, má více virtuálních počítačů smlouvu SLA s nejvyšší dostupností, pokud je distribuovaná napříč několika zónami dostupnosti. U virtuálních počítačů a disků distribuovaných napříč několika zónami dostupnosti se disky a jejich nadřazené virtuální počítače kompletují do stejné zóny, což brání v výpadku více virtuálních počítačů, i když dojde k výpadku celé zóny.

Pokud nejsou zóny dostupné nebo vaše úloha je citlivá na latenci mezi virtuálními počítači, nasaďte virtuální počítače a disky napříč několika doménami selhání. Domény selhání neposkytují redundanci zón, ale snižují dopad selhání hardwaru, výpadků sítě nebo přerušení napájení. Zabráníte tak selhání několika virtuálních počítačů, pokud dojde k výpadku jedné domény selhání úložiště.

Odolnost proti přechodným chybám

Přechodné chyby jsou krátká, přerušovaná selhání ve složkách. V distribuovaném prostředí, jako je cloud, se vyskytují často a jsou normální součástí provozu. Přechodné chyby se opravují po krátké době. Je důležité, aby vaše aplikace mohly zpracovávat přechodné chyby, obvykle opakováním ovlivněných požadavků.

Všechny aplikace hostované v cloudu by měly postupovat podle Azure pokynů pro zpracování přechodných chyb, když komunikují s libovolnými rozhraními API, databázemi a dalšími komponentami hostovanými v cloudu. Další informace najdete v tématu Doporučení pro zpracování přechodných chyb.

Spravované disky se automaticky obnoví z přechodných chyb v infrastruktuře Azure.

Odolnost proti chybám zóny dostupnosti

zóny dostupnosti jsou fyzicky oddělené skupiny datacenter v rámci Azure oblasti. Když jedna zóna selže, mohou služby přejít na jednu ze zbývajících zón.

Zóny dostupnosti se spravovanými disky můžete používat dvěma způsoby:

  • Můžete nasadit disk ZRS, který se nachází ve třech zónách dostupnosti v rámci oblasti. Pro zajištění nejlepší spolehlivosti doporučujeme používat disky ZRS, protože disky ZRS poskytují automatickou odolnost zón.
  • Můžete nasadit zónový disk LRS, který se nachází pouze v jedné zóně. Pokud používáte zónové disky LRS, zodpovídáte za konfiguraci úlohy tak, aby byla odolná vůči výpadkům zón. Tuto odolnost dosáhnete nasazením několika virtuálních počítačů a disků a jejich umístěním napříč zónami dostupnosti.

Pokud podporu zóny dostupnosti nenakonfigurujete, je disk nezonální nebo oblastní a může být umístěn v jakékoli zóně dostupnosti v dané oblasti. Tyto disky se považují za LRS, protože se replikují v rámci oblasti.

Zónově redundantní disky

ZRS synchronně replikuje vaše data napříč třemi zónami dostupnosti v rámci oblasti. Když povolíte redundanci zóny pro spravovaný disk, Azure zajistí, že selhání v jakékoli jedné zóně neovlivní dostupnost dat.

Diagram zónově redundantního disku Jeho repliky jsou rozloženy do tří zón dostupnosti v dané oblasti.

Disky ZRS se dají sdílet mezi virtuálními počítači za účelem zlepšení dostupnosti clusterovaných nebo distribuovaných aplikací, jako jsou SQL Server FCI, SAP ASCS/SCS nebo GFS2. Sdílený disk ZRS můžete připojit k primárním a sekundárním virtuálním počítačům v různých zónách a využívat tak disky ZRS i virtuální počítače distribuované napříč několika zónami dostupnosti. Pokud primární zóna selže, můžete pomocí trvalé rezervace SCSI rychle přepnout převzetí služeb na sekundární virtuální počítač.

Pokud je disk ZRS připojený jako datový disk k jednomu virtuálnímu počítači v zóně, která se vypne, můžete vynutit odpojení disku od neúspěšného virtuálního počítače a jeho připojení k jinému virtuálnímu počítači.

Požadavky

  • Podpora oblastí: Seznam oblastí, které podporují spravované disky ZRS, najdete v tématu Možnosti redundance spravovaných disků.

  • Typy disků: Zónově redundantní disky se podporují se spravovanými disky SSD úrovně Premium a SSD úrovně Standard. ZRS není podporováno pro disky Premium SSD v2, Ultra disky nebo spravované disky Standard HDD.

Náklady

ZRS způsobuje vyšší náklady než LRS kvůli dodatečné režii replikace a infrastruktuře, která je nutná k údržbě dat napříč několika zónami. Přesný rozdíl nákladů se liší podle oblasti a typu disku. Pro informace o cenách spravovaných disků Azure, podívejte se na ceny spravovaných disků Azure.

Konfigurujte podporu zón dostupnosti

  • Vytvoření nového disku ZRS: Vytvoření nového spravovaného disku ZRS viz Tutorial – Správa disků Azure pomocí Azure CLI pro virtuální počítače s Linuxem nebo Tutorial: Správa disků pomocí Azure PowerShell pro virtuální počítače Windows. Během vytváření disku vyberte vrstvu disku ZRS.

    Zodpovídáte za připojení disku k virtuálním počítačům, včetně konfigurace sdílených disků na více virtuálních počítačích v různých zónách, pokud je to vhodné pro vaši úlohu.

  • Změňte existující disk tak, aby používal ZRS: Existující nezonální (regionální) disk můžete převést na ZRS.

    I když nemůžete převést zónový disk LRS na ZRS, můžete vytvořit nový disk ZRS ze snímku. Podrobné postupy a požadavky migrace najdete v tématu Převod disku z LRS na ZRS .

  • Zakázání podpory zóny dostupnosti: Nemůžete změnit konfiguraci zóny dostupnosti existujícího disku ZRS. Místo toho je potřeba vytvořit nový disk s novou konfigurací pomocí snímku z předchozího disku a potom odstranit starý disk.

Chování, když jsou všechny zóny v pořádku

Tato část popisuje, co očekávat při konfiguraci spravovaných disků pro ZRS a všechny zóny dostupnosti jsou funkční.

  • Operace Mezi zónami: Azure automaticky spravuje směrování provozu mezi zónami dostupnosti, když používáte virtuální počítač se zónově redundantním diskem. Během normálních operací se požadavky transparentně distribuují napříč zónami.

  • Replikace dat mezi zónami: Disky ZRS replikují každý zápis synchronně napříč několika zónami dostupnosti v dané oblasti. Operace zápisu se dokončí až po uložení dat v clusterech ve více zónách. Tento přístup poskytuje silnou konzistenci a vysokou dostupnost, ale ve srovnání s disky LRS může představovat mírně vyšší latenci zápisu.

Chování při selhání zóny

Tato část popisuje, co očekávat, když nakonfigurujete spravovaný disk pro ZRS a dojde k výpadku v jedné ze zón dostupnosti.

  • Detekce a odpověď: Výpadky zón můžou mít vliv jenom na disky, pouze virtuální počítače nebo obojí. Chování závisí na tom, jestli výpadek zóny ovlivňuje virtuální počítač připojený k disku.

    Pokud virtuální počítač zůstane v pořádku, ale na disk má vliv výpadek, virtuální počítač bude dál fungovat. Microsoft automaticky přesměruje diskové operace, aby fungovaly s daty v zónách dostupnosti, které jsou v pořádku, a nemusíte nic dělat.

    Pokud je virtuální počítač vypnutý, musíte úlohu přepnout na jiný virtuální počítač v jiné zóně dostupnosti.

    • Sdílené disky: Pokud jste už vytvořili sekundární virtuální počítač v jiné zóně a nakonfigurovali sdílené disky, je disk dostupný pro sekundární virtuální počítač, který se má použít. Nejsou vyžadovány žádné změny konfigurace.

    • Disky, které nejsou sdílené: Můžete vynutit odpojení disku od neúspěšného virtuálního počítače a jeho připojení k virtuálnímu počítači v dobré zóně. Provedení vynuceného odpojení:

  • Notification: Microsoft vás při výpadku zóny automaticky neoznámí. Pomocí Azure Resource Health ale můžete monitorovat stav jednotlivých prostředků a můžete nastavit výstrahy Resource Health, které vás upozorní na problémy. Můžete také použít Azure Service Health k pochopení celkového stavu služby, včetně jakýchkoli selhání zóny, a můžete nastavit upozornění služby Service Health, která vás upozorní na problémy.
  • Očekávaná ztráta dat: Během selhání zóny nedojde ke ztrátě dat.

  • Očekávaný výpadek: Při sdílení disku mezi několika virtuálními počítači se neočekává žádný výpadek.

  • Redistribution: Azure automaticky směruje provoz na jinou kopii disku, která je v dobré zóně.

Obnovení zóny

Azure automaticky zjistí, kdy je dříve neúspěšná zóna v pořádku, a obnoví synchronizaci dat do obnovené zóny.

Disky LRS zónové

Zónové disky LRS se nacházejí v konkrétní zóně dostupnosti a připojují se pouze k virtuálním počítačům v této zóně. Všechny kopie dat disku jsou ve stejné zóně. Jeden zónový disk LRS a virtuální počítač neposkytují odolnost zón. Pokud dojde k výpadku zóny, která obsahuje disk, může být disk nedostupný.

Diagram zobrazující zónový disk LRS. Všechny jeho repliky jsou v jedné zóně dostupnosti.

U úloh s více virtuálními počítači můžete dosáhnout odolnosti zón nasazením několika virtuálních počítačů a jejich zónových disků LRS napříč různými zónami dostupnosti. Tento přístup je nejběžnějším způsobem, jak dosáhnout vysoké dostupnosti pro úlohy, jako jsou webové servery, aplikační vrstvy a databázové clustery. Pokud zóna selže, můžete úlohu nakonfigurovat tak, aby pokračovala v provozu pomocí virtuálních počítačů v zónách, které jsou v pořádku.

Diagram znázorňující tři virtuální počítače v různých zónách, každý s vlastním zónovým diskem LRS

Tento model distribuce s více zónami funguje se všemi typy disků, včetně disků SSD úrovně Premium v2 a Ultra, které podporují pouze LRS. Další informace o tomto přístupu najdete v tématu Distribuce virtuálních počítačů a disků napříč zónami dostupnosti.

Požadavky

Náklady

Za zónové disky LRS se účtují stejné sazby jako nezonální disky. Pro informace o cenách spravovaných disků Azure, podívejte se na ceny spravovaných disků Azure.

Konfigurujte podporu zón dostupnosti

  • Vytvoření nového disku s podporou zóny dostupnosti: Vytvoření nového spravovaného disku s redundancí zón LRS viz Tutorial – Správa disků Azure pomocí Azure CLI pro virtuální počítače s Linuxem nebo Tutorial – Správa disků pomocí Azure PowerShell pro virtuální počítače Windows.

    Během vytváření disku vyberte zónu dostupnosti.

    Důležité

    Připnutí do jedné zóny dostupnosti se doporučuje jenom v případě, že je latence napříč zónami pro vaše potřeby příliš vysoká a po ověření, že latence nesplňuje vaše požadavky. Samotný zónový prostředek neposkytuje odolnost vůči výpadku zóny dostupnosti. Chcete-li zlepšit odolnost zónového prostředku, musíte explicitně nasadit samostatné prostředky do více zón dostupnosti a nakonfigurovat směrování provozu a zajištění převzetí služeb při selhání. Další informace najdete v tématu Zónové prostředky a odolnost zón.

  • Změna konfigurace zóny dostupnosti existujícího disku: Konfiguraci zóny dostupnosti existujícího zónového disku LRS nemůžete změnit. Místo toho je potřeba vytvořit nový disk, který má novou konfiguraci, pomocí snímku z předchozího disku a potom odstranit starý disk.

Chování, když jsou všechny zóny v pořádku

Tato část popisuje, co očekávat při konfiguraci spravovaného disku pro zónové LRS a všechny zóny dostupnosti jsou funkční.

  • Operace napříč zónami: Provoz mezi zónovým virtuálním počítačem a zónovým diskem LRS ve stejné zóně zůstává v rámci zóny dostupnosti.

    Když nasadíte více virtuálních počítačů napříč zónami, zodpovídáte za distribuci příchozích požadavků mezi virtuální počítače. Každý virtuální počítač načítá a zapisuje do svého vlastního zónového disku.

  • Replikace dat mezi zónami: Všechny operace zápisu na zónové disky LRS se replikují synchronně v rámci zóny dostupnosti.

    Když nasadíte více virtuálních počítačů napříč zónami, pokud vaše úloha vyžaduje konzistenci dat napříč virtuálními počítači, zodpovídáte za synchronizaci dat. Můžete například použít replikaci databáze nebo replikaci aplikační vrstvy.

Chování při selhání zóny

Tato část popisuje, co očekávat, když nakonfigurujete spravovaný disk pro zónovou zónu LRS a v jedné ze zón dostupnosti dojde k výpadku.

  • Detekce a odpověď: Pokud máte jeden virtuální počítač s zónovým diskem LRS, zodpovídáte za zjištění výpadku zóny a aktivaci převzetí služeb při selhání nebo jiné odpovědi.

    Pokud máte virtuální počítače distribuované napříč několika zónami, zodpovídáte za konfiguraci úlohy, abyste zjistili selhání zón a pokračovali v provozu na virtuálních počítačích, které jsou v zónách v pořádku.

  • Notification: Microsoft vás při výpadku zóny automaticky neoznámí. Pomocí Azure Resource Health ale můžete monitorovat stav jednotlivých prostředků a můžete nastavit výstrahy Resource Health, které vás upozorní na problémy. Můžete také použít Azure Service Health k pochopení celkového stavu služby, včetně jakýchkoli selhání zóny, a můžete nastavit upozornění služby Service Health, která vás upozorní na problémy.
  • Očekávaná ztráta dat: Replikace LRS poskytuje alespoň 99,9999999999% (11 9s) stálosti, takže disk uchovává data a data je možné obnovit po obnovení zóny.

    Pokud máte virtuální počítače distribuované napříč zónami, všechna data, která byla pouze na discích v zóně selhání, je dočasně nedostupná. Pokud vaše aplikace synchronizuje data mezi virtuálními počítači, budou virtuální počítače v zónách v pořádku dál obsluhovat požadavky pomocí vlastních dat.

  • Očekávaný výpadek: Jeden zónový disk LRS není k dispozici, dokud se zóna dostupnosti neobnoví.

    Pokud máte virtuální počítače a disky distribuované napříč zónami, vaše úloha může dál fungovat na virtuálních počítačích v zónách, které jsou v pořádku.

  • Přerozdělování: Pokud máte jeden virtuální počítač s zónovým diskem LRS, zodpovídáte za přesměrování provozu na jiný virtuální počítač, pokud máte k dispozici jeden.

    Pokud máte virtuální počítače distribuované napříč zónami, můžete svou úlohu nakonfigurovat tak, aby automaticky redistribuoval provoz do virtuálních počítačů v zónách, které jsou v pořádku.

Obnovení zóny

Když se po selhání zóna dostupnosti obnoví, spravované disky se obnoví automaticky. Pokud došlo k výpadku virtuálního počítače připojeného k disku, restartuje se. Pokud je použijete, zodpovídáte za opětovnou synchronizaci aplikačních dat s jinými virtuálními počítači a disky v jiných zónách dostupnosti.

Testování poruch zón

Selhání zón nemůžete přímo simulovat na úrovni disku, ale můžete použít podporu Azure Chaos Studio pro simulaci událostí snížení pásma ve škálovacích sadách virtuálních počítačů a simulací ztrátu jednotlivých virtuálních počítačů.

Během výpadků byste měli otestovat odolnost aplikace vůči selháním zón a chování spravovaných disků. Monitorujte výkon disku během simulovaných výpadků zóny a ověřte, že vaše aplikace odpovídajícím způsobem zpracovávají zvýšenou latenci. Implementujte automatizované testovací scénáře, které ověřují, že vaše aplikace můžou zpracovávat dočasné vstupně-výstupní prodlevy a vynucují operace odpojení sdílených disků.

Odolnost proti selháním v celé oblasti

Azure Disk Storage je služba s jednou oblastí, která funguje v rámci hranic konkrétní Azure oblasti. Služba neposkytuje nativní funkce pro více oblastí ani automatické převzetí služeb při selhání mezi oblastmi. Pokud se nějaký region stane nedostupným, zdroje spravovaných disků v tomto regionu jsou také nedostupné.

Vlastní řešení pro více regionů pro zajištění odolnosti

Řešení ve více oblastech můžete vytvořit nasazením virtuálních počítačů a disků v každé oblasti, replikací nebo zálohováním dat napříč oblastmi a převzetím služeb při selhání nebo obnovením ze záloh v případě potřeby. Zodpovídáte za správu prostředků v každém regionu, koordinaci a synchronizaci dat a řešení převzetí služeb při selhání nebo obnovy. Mezi běžné přístupy patří:

Zálohování a obnovení

Azure spravované disky podporují různé přístupy k zálohování, které chrání před ztrátou a poškozením dat. zálohování disků Azure je nativní cloudové řešení, které automatizuje správu životního cyklu snímků. Poskytuje havarijně konzistentní přírůstkové zálohování s konfigurovatelnými zásadami retence. Tento přístup bez agentů podporuje více záloh za den, aniž by to ovlivnilo výkon aplikací a integruje se s Azure Backup centrem pro centralizovanou správu. Přírůstkové snímky můžete použít ke snížení nákladů na úložiště a časů zálohování.

Pro ochranu na úrovni VM poskytuje Azure Backup zálohy konzistentní vzhledem k aplikacím pro celý virtuální počítač, včetně všech připojených disků. Tento přístup je ideální v případě, že potřebujete koordinované zálohování více disků nebo záloh pracujících s aplikacemi. U databázových úloh zvažte řešení zálohování specifická pro aplikace, která poskytují ochranu konzistentní vzhledem k transakcím a rychlejší možnosti obnovení.

Pro důležité úlohy implementujte strategii vrstveného zálohování, která kombinuje zálohování disků Azure, replikaci snímků mezi oblastmi a zálohy na úrovni aplikace pro konzistenci transakcí. Nakonfigurujte zásady zálohování na základě vašich požadavků na obnovení, potřeb dodržování předpisů a požadavků na náklady.

Smlouva o úrovni služeb

Smlouva o úrovni služeb (SLA) pro služby Azure popisuje očekávanou dostupnost každé služby a podmínky, které musí vaše řešení splnit, aby bylo dosaženo očekávané dostupnosti. Další informace najdete v tématu SLA pro online služby.

Azure Disk Storage neposkytuje vlastní smlouvu SLA o dostupnosti, ale je součástí smlouvy SLA pro virtuální počítače. Konfigurace disku může ovlivnit smlouvu SLA o dostupnosti virtuálního počítače.