Spolehlivost v Azure NetApp Files

Azure NetApp Files je nativní řešení podnikového úložiště souborů, které se bezproblémově integruje v rámci Azure a umožňuje sdílení souborů mezi klienty prostřednictvím protokolů NFS (Network File System) a SMB (Server Message Block). Azure NetApp Files je navržená pro vysoký výkon a poskytuje škálovatelné a zabezpečené úložiště souborů spravované jako služba.

Při použití Azure je spolehlivost sdílenou odpovědností. Microsoft nabízí celou řadu možností, které podporují odolnost a obnovení. Zodpovídáte za pochopení toho, jak tyto možnosti fungují ve všech službách, které používáte, a výběrem možností, které potřebujete ke splnění vašich obchodních cílů a cílů dostupnosti.

Tento článek popisuje, jak zajistit odolnost služby NetApp Files vůči nejrůznějším potenciálním výpadkům a problémům, včetně přechodných chyb, výpadků zón dostupnosti a výpadků oblastí. Popisuje také, jak můžete pomocí záloh zotavit z jiných typů problémů a zvýrazní některé klíčové informace o smlouvě o úrovni služeb (SLA) Azure NetApp Files.

Doporučení pro nasazení do produkčního prostředí

Další informace o nasazení Azure NetApp Files pro podporu požadavků na spolehlivost vašeho řešení a o tom, jak spolehlivost ovlivňuje další aspekty architektury, najdete v osvědčených postupech Architecture pro Azure NetApp Files v Azure Well-Architected Framework.

Přehled architektury spolehlivosti

Pokud chcete použít Azure NetApp Files, musíte nakonfigurovat účet NetApp, který obsahuje fondy capacity, které hostují volumes. Kapacitu a propustnost můžete nakonfigurovat nezávisle a spravovat možnosti ochrany dat, které vyhovují různým potřebám. Replikaci mezi svazky můžete povolit, i když jsou v různých umístěních.

Odolnost proti přechodným chybám

Přechodné chyby jsou krátká, přerušovaná selhání ve složkách. V distribuovaném prostředí, jako je cloud, se vyskytují často a jsou normální součástí provozu. Přechodné chyby se opravují po krátké době. Je důležité, aby vaše aplikace mohly zpracovávat přechodné chyby, obvykle opakováním ovlivněných požadavků.

Všechny aplikace hostované v cloudu by měly postupovat podle Azure pokynů pro zpracování přechodných chyb, když komunikují s libovolnými rozhraními API, databázemi a dalšími komponentami hostovanými v cloudu. Další informace viz Doporučení pro zpracování přechodných selhání.

Kromě přechodných typů chyb, které můžou ovlivnit jakékoli cloudové řešení, může občasná plánovaná údržba, jako jsou aktualizace platformy, aktualizace služeb a upgrady softwaru, ovlivnit také Azure NetApp Files.

Z pohledu protokolů souborů, jako jsou NFS a SMB, nejsou přechodné chyby rušivé, pokud aplikace dokáže zpracovat vstupně-výstupní pozastavení, ke kterým může během těchto událostí dojít. Vstupně-výstupní pozastavení jsou obvykle krátké, od několika sekund do 30 sekund. Některé aplikace můžou vyžadovat optimalizaci pro zpracování I/O pauz.

Protokol NFS je robustní a operace se soubory klientského serveru obvykle normálně pokračují. Některé aplikace mohou vyžadovat úpravu pro zvládnutí vstupně-výstupních pozastavení po dobu 30 až 45 sekund. Ujistěte se, že víte o nastavení odolnosti aplikace, abyste se mohli vypořádat s událostmi údržby služby úložiště.

U aplikací interaktivních pro člověka, které používají protokol SMB, jsou obvykle dostatečná standardní nastavení protokolu. Azure NetApp Files také podporuje průběžnou dostupnost SMB, což umožňuje transparentní selhání SMB. Transparentní převzetí služeb při selhání SMB eliminuje přerušení, která způsobují události údržby. Zvyšuje také spolehlivost a uživatelské prostředí.

Nepřetržitá dostupnost protokolu SMB je dostupná jenom pro konkrétní aplikace.

Další doporučení najdete v tématu Nejčastější dotazy k odolnosti aplikací pro Azure NetApp Files.

Odolnost proti chybám zóny dostupnosti

zóny dostupnosti jsou fyzicky oddělené skupiny datacenter v rámci Azure oblasti. Když jedna zóna selže, mohou služby přejít na jednu ze zbývajících zón.

Azure NetApp Files podporuje zónové nasazení svazků. Pomocí funkce umístění svazků v zóně dostupnosti v Azure NetApp Files nasaďte každý svazek do jediné zóny dostupnosti dle vašeho výběru. Tuto funkci můžete použít jenom v případě, že Azure NetApp Files v této zóně dostupnosti existuje a má dostatečnou kapacitu. Pokud máte aplikace citlivé na latenci, můžete svazek nasadit do stejné zóny dostupnosti jako vaše Azure výpočetní prostředky a další služby.

V následujícím diagramu oranžové šipky s plnými hroty představují způsob, jakým mají všechny virtuální počítače v rámci oblasti v propojených virtuálních sítích přístup ke všem prostředkům Azure NetApp Files. Zelené šipky představují způsob, jakým virtuální počítače, které přistupují ke svazkům Azure NetApp Files ve stejné zóně, sdílejí doménu selhání v rámci zóny dostupnosti. Mezi různými svazky na úrovni platformy není žádná replikace.

Diagram, který zobrazuje umisťování svazků Azure NetApp Files v zónách dostupnosti.

Diagram znázorňuje tři zóny dostupnosti v Azure oblasti. Oranžové šipky s plnými hroty šipek spojují ikony, které představují virtuální počítače a prostředky Azure NetApp Files v různých zónách dostupnosti. Ve stejné zóně dostupnosti zelené šipky spojují virtuální počítače a svazky Azure NetApp Files.

Jednozónové nasazení nestačí ke splnění požadavků na vysokou spolehlivost. Pokud chcete asynchronně replikovat data mezi svazky v různých zónách dostupnosti, můžete použít replikaci mezi zónami. Replikaci mezi zónami je třeba nakonfigurovat odděleně od umisťování svazků do zón dostupnosti.

Pokud dostupnostní zóna selže, jste zodpovědní za zjištění selhání a za přepnutí na alternativní svazek v jiné zóně.

Požadavky

  • podpora oblastí Region: Replikace mezi zónami je dostupná ve všech oblastech s podporou zón dostupnosti , které podporují Azure NetApp Files.

  • Tenant Microsoft Entra: Replikace je povolena mezi různými předplatnými Azure pouze v případě, že jsou ve stejném tenantovi Microsoft Entra.

Úvahy

Umístění svazků v zóně dostupnosti v Azure NetApp Files umožňuje umístění svazků do konkrétní zóny. Při připojení k virtuálním počítačům ve stejné zóně dostupnosti se zobrazí nízká latence. Umístění svazku v zónách dostupnosti však nezajišťuje blízké umístění s virtuálními počítači nebo jinými prostředky, a svazek tak může být v jiné fyzické části datacentra.

Další důležité informace o zónách dostupnosti v Azure NetApp Files najdete v tématu Požádky a důležité informace o používání replikace mezi zónami a Spravování umístění svazků zóny dostupnosti.

Náklady

Za povolení umístění svazku zóny dostupnosti v Azure NetApp Files se neúčtují žádné další poplatky. Platíte jenom za kapacitní fondy a prostředky, které nasazujete v těchto zónách.

Replikované svazky jsou hostované ve fondu kapacity. Náklady na replikaci mezi zónami jsou založeny na velikosti a úrovni zřízeného fondu kapacity. Za replikaci dat nejsou žádné další náklady.

Konfigurujte podporu zón dostupnosti

Musíte samostatně nakonfigurovat umístění svazku a replikaci napříč zónami.

Chování, když jsou všechny zóny v pořádku

Tato část popisuje, co očekávat, když se do samostatných zón dostupnosti nasadí více Azure NetApp Files svazků, povolí se replikace mezi zónami a všechny zóny dostupnosti budou funkční.

  • Směrování provozu mezi zónami: Příchozí požadavky se směrují na konkrétní svazek, který se nachází v zóně dostupnosti, kterou vyberete.

  • Data replikace mezi zónami: Azure NetApp Files replikace mezi zónami znamená, že všechny změny zdrojového svazku se asynchronně replikují do cílových svazků. Můžete se rozhodnout, jak často replikace probíhá. Replikace mezi zónami podporuje tři plány replikace: každých 10 minut, hodinově a denně.

    Důležité

    10minutový plán replikace se nepodporuje u velkých svazků , které používají replikaci mezi zónami.

Chování při selhání zóny

Tato část popisuje, co očekávat, když se do samostatných zón dostupnosti nasadí více Azure NetApp Files svazků, povolí se replikace mezi zónami a dojde k výpadku zóny dostupnosti.

  • Detekce a reakce: Jste zodpovědní za detekci ztráty zóny dostupnosti a iniciaci procesu převzetí služeb při selhání.

    Převzetí služeb při selhání je manuální proces. Pokud potřebujete aktivovat cílový svazek, například když chcete provést přepnutí při selhání do cílové zóny dostupnosti, musíte zrušit spojení replikace a poté připojit cílový svazek. Další informace najdete v tématu automatické přesměrování na cílový svazek při výpadku.

  • Notification: Ke sledování stavu svazku Azure NetApp Files můžete použít metriky Azure Monitor. Azure Monitor detekuje všechny anomálie, které naznačují scénář výpadku zóny, prostřednictvím metrik zaznamenávaných v reálném čase, jako jsou vstupně-výstupní operace za sekundu (IOPS), latence a využití kapacity. Výstrahy a oznámení můžete nakonfigurovat tak, aby odesílali správcům, aby mohli okamžitě reagovat vyrovnáním sdílených složek nebo zahájením převzetí služeb při selhání nebo jinými protokoly zotavení po havárii.

  • Aktivní požadavky: Během události výpadku zóny můžou aktivní žádosti zaznamenat přerušení nebo vyšší latence.

  • Očekávaná ztráta dat: Velikost ztráty dat nebo cíle bodu obnovení (RPO), které můžete očekávat během převzetí služeb při selhání zóny, závisí na plánu replikace mezi zónami, který nakonfigurujete.

    Plán replikace Typický časový cíl RPO
    Každých 10 minut 20 minut
    Hodinově Dvě hodiny
    Každý den Méně než 48 hodin
  • Očekávaný výpadek: Převzetí služeb při selhání do jiné zóny vyžaduje, abyste přerušili partnerský vztah, abyste aktivovali cílový svazek a poskytli přístup ke čtení a zápisu dat na druhém místě. Poté, co vyvoláte přerušení partnerství, můžete očekávat, že převzetí služeb při selhání se dokončí během jedné minuty.

    Nicméně celková doba výpadku nebo cílová doba obnovení (RTO), kterou můžete očekávat během převzetí služeb při selhání zóny, závisí na několika faktorech, včetně toho, jak dlouho trvá vašim systémům nebo procesům zjistit ztrátu zóny a zahájit procesy převzetí při selhání. Je také důležité se rozhodnout, jestli se má automatizovat odpověď nebo jestli se vyžadují ruční kroky. Pro dobře připravené konfigurace obvykle celý proces vyžaduje několik minut až hodinu, než se dokončí.

  • Přesměrování provozu: Zodpovídáte za přesměrování provozu aplikace pro připojení k nově aktivnímu cílovému svazku. Další informace najdete v tématu automatické přesměrování na cílový svazek při výpadku.

Obnovení zóny

Failback je ruční proces, který vyžaduje provedení resynchronizace, obnovení replikace a připojení zdrojového svazku, aby měl klient přístup. Další informace najdete v tématu Spravování zotavení po havárii pomocí Azure NetApp Files.

Testování poruch zón

Konfiguraci replikace mezi jednotlivými zónami můžete bezpečně otestovat pomocí snímků vašeho svazku. Další informace o přístupu vysoké úrovně k otestování konfigurace replikace mezi zónami najdete v tématu Test zotavení po havárii pro Azure NetApp Files.

Odolnost proti selháním v celé oblasti

Ve výchozím nastavení je Azure NetApp Files služba omezená na jednu oblast. Pokud se oblast stane nedostupnou, svazky uložené v této oblasti jsou také nedostupné. Pokud dojde k regionálnímu výpadku, Azure NetApp Files podporuje replikaci mezi oblastmi. Data ze svazku Azure NetApp Files (zdroje) v jedné oblasti můžete asynchronně replikovat do jiného Azure NetApp Files svazku (cíl) v jiné oblasti, kterou Microsoft předem vybral. Tato funkce umožňuje přepnout kritickou aplikaci, pokud dojde k výpadku nebo havárii v rámci regionu.

Poznámka:

Můžete také replikovat jeden svazek do jiné zóny dostupnosti a do jiné oblasti. Další informace najdete v tématu Pochopení replikace Azure NetApp Files.

Požadavky

Podporované oblasti: Sekundární oblast, do které lze replikovat vaše svazky, závisí na primární oblasti. Další informace najdete v podporovaných párech oblastí.

Úvahy

Replikace je povolená mezi různými předplatnými Azure jenom v případě, že jsou ve stejném tenantovi Microsoft Entra.

Další aspekty související s replikací mezi oblastmi v Azure NetApp Files najdete v tématu Požádky a důležité informace o používání replikace mezi oblastmi.

Náklady

Poplatky za replikaci mezi oblastmi jsou založené na množství replikovaných dat. Další informace a některé ukázkové scénáře najdete v tématu Model nákladů pro replikaci mezi oblastmi.

Nakonfigurujte podporu pro více oblastí

Chování, když jsou všechny oblasti v pořádku

Tato část popisuje, co očekávat, když jsou svazky Azure NetApp Files nakonfigurované tak, aby používaly replikaci mezi oblastmi a obě oblasti jsou funkční.

  • Směrování provozu mezi oblastmi: Příchozí požadavky se směrují na konkrétní svazek, který se nachází v primární oblasti.

  • Replikace dat mezi oblastmi: Replikace Azure NetApp Files mezi oblastmi znamená, že všechny změny zdrojového svazku se asynchronně replikují do cílových svazků. Můžete se rozhodnout, jak často replikace probíhá. Replikace mezi oblastmi podporuje tři plány replikace: každých 10 minut, hodinově a denně.

    Důležité

    10minutový plán replikace se nepodporuje u velkých svazků , které používají replikaci mezi oblastmi.

  • Monitorování stavu replikace: Můžete monitorovat stav peeringu a můžete nakonfigurovat výstrahy, které vás upozorní, pokud prodleva replikace přesáhne očekávaný práh. Další informace najdete v tématu Zobrazení stavu a monitorování stavu vztahu replikace.

Chování při selhání oblasti

Tato část popisuje, co očekávat, když jsou svazky Azure NetApp Files nakonfigurované tak, aby používaly replikaci mezi oblastmi a došlo k výpadku primární oblasti.

  • Detekce a reakce: Jste zodpovědní za zjištění ztráty oblasti a zahájení převzetí služeb při selhání. Převzetí služeb při selhání je manuální proces. Když potřebujete aktivovat cílový svazek, například když chcete převést provoz na cílovou oblast při selhání, musíte přerušit partnerský vztah replikace a poté připojit cílový svazek. Další informace najdete v tématu automatické přesměrování na cílový svazek při výpadku.

  • Notification: Ke sledování stavu svazku Azure NetApp Files můžete použít metriky Azure Monitor. Azure Monitor detekuje všechny anomálie, které označují scénář mimo oblast, prostřednictvím metrik v reálném čase, jako jsou IOPS, latence a využití kapacity. Výstrahy a oznámení můžete nakonfigurovat tak, aby odesílali správcům, aby mohli okamžitě reagovat vyrovnáním sdílených složek nebo zahájením převzetí služeb při selhání nebo jinými protokoly zotavení po havárii.

  • Aktivní požadavky: Během události mimo oblast můžou aktivní požadavky zaznamenat přerušení nebo zvýšenou latenci.

  • Očekávaná ztráta dat: Velikost ztráty dat neboli cílový bod obnovení, kterou můžete očekávat při selhání oblasti, závisí na plánu replikace mezi oblastmi, který nakonfigurujete.

    Plán replikace Typický časový cíl RPO
    Každých 10 minut Méně než 20 minut
    Hodinově Méně než dvě hodiny
    Každý den Méně než 48 hodin
  • Očekávaný výpadek: Převzetí služeb při selhání do jiné oblasti vyžaduje, abyste přerušili partnerský vztah, aby se aktivoval cílový svazek a poskytoval přístup pro čtení a zápis v druhém místě. Poté, co vyvoláte přerušení partnerství, můžete očekávat, že převzetí služeb při selhání se dokončí během jedné minuty.

    Celková doba výpadku neboli RTO, kterou můžete během převzetí služeb při selhání oblasti očekávat, však závisí na několika faktorech, včetně toho, jak dlouho vašim systémům nebo procesům trvá, než zjistí výpadek oblasti a spustí procesy převzetí služeb při selhání. Je také důležité se rozhodnout, jestli se má automatizovat odpověď nebo jestli se vyžadují ruční kroky. Pro dobře připravené konfigurace obvykle celý proces vyžaduje několik minut až hodinu, než se dokončí.

  • Přesměrování provozu: Zodpovídáte za přesměrování provozu aplikace pro připojení k nově aktivnímu cílovému svazku. Další informace najdete v tématu automatické přesměrování na cílový svazek při výpadku.

Obnovení oblasti

cs-CZ: Po obnovení primární oblasti zodpovídáte za přepnutí zpět. Failback je ruční proces, který vyžaduje provedení resynchronizace, obnovení replikace a připojení zdrojového svazku, aby měl klient přístup. Další informace najdete v tématu Spravování zotavení po havárii pomocí Azure NetApp Files.

Testování selhání regionů

Konfiguraci meziregionální replikace můžete bezpečně otestovat pomocí snímků svazků. Další informace o přístupu vysoké úrovně k otestování konfigurace replikace mezi oblastmi najdete v tématu Test zotavení po havárii pro Azure NetApp Files.

Zálohování a obnovení

Azure NetApp Files zálohování rozšiřuje možnosti ochrany dat Azure NetApp Files tím, že poskytuje plně spravované řešení zálohování pro dlouhodobé obnovení, archivaci a dodržování předpisů. Zálohy, které služba vytvoří, se ukládají v Azure úložišti nezávisle na snímcích svazků, které jsou k dispozici pro krátkodobé obnovení nebo klonování. Zálohy, které služba přijímá, je možné obnovit na nové Azure NetApp Files svazky v rámci oblasti. Zálohování Azure NetApp Files podporuje jak zálohování založené na zásadách (plánované), tak ruční zálohování (na vyžádání).

Pro větší bezpečnost přidávají snímky Azure NetApp Files stabilitu, škálovatelnost a rychlou obnovitelnost, aniž by ovlivnily výkon. Poskytují základ pro další řešení redundance, včetně zálohování, replikace mezi oblastmi a replikace mezi zónami.

U většiny řešení byste se neměli spoléhat výhradně na zálohy. Místo toho využijte další funkce popsané v tomto průvodci k podpoře vašich požadavků na odolnost. Zálohy ale chrání před některými riziky, která jiné přístupy nechrání. Další informace najdete v tématu Co jsou redundance, replikace a zálohování?.

Odolnost vůči údržbě služeb

Během údržby služby nebo platformy může docházet k krátkým přerušením vstupně-výstupních operací. Vaše úlohy by měly být odolné vůči těmto typům přerušení. Další informace naleznete v tématu Odolnost aplikace – Události údržby.

Smlouva o úrovni služeb

Smlouva o úrovni služeb (SLA) pro služby Azure popisuje očekávanou dostupnost každé služby a podmínky, které musí vaše řešení splnit, aby bylo dosaženo očekávané dostupnosti. Další informace najdete v tématu SLA pro online služby.