Architektúrastratégiák vészhelyreállításhoz

Az Azure Well-Architected-keretrendszer megbízhatósági ellenőrzőlistájára vonatkozó javaslat:

RE:09 A helyreállítási céloknak megfelelő strukturált, tesztelt és dokumentált vészhelyreállítási (DR) tervek implementálása. A terveknek az összes összetevőre és a rendszer egészére ki kell terjedniük.

A katasztrófák jelentős incidensek, amelyek gondos tervezést és proaktív előkészítést igényelnek a számítási feladatok és az üzemeltetési csapatok részéről.

Ez a cikk a vészhelyreállítás fő stratégiáit ismerteti, kiemelve a rugalmas számítási feladatok tervezését, az adatok integritását és a feladatátvétel és helyreállítás egyértelműen meghatározott célkitűzéseit. A részletes eljárások helyett a DR céljára és alapelveire összpontosít. Részletes megvalósítási útmutatásért, beleértve a lépésenkénti folyamatokat és forgatókönyveket, tekintse meg a következő társcikket: Vészhelyreállítási terv kidolgozása többrégiós üzemelő példányokhoz.

Definíciók

Időszak Definíció
Aktív-passzív hideg készenléti állapot Egy DR üzembe helyezési minta, amelyben a másodlagos régióban minimálisan vagy egyáltalán nincs működő infrastruktúra a katasztrófa bekövetkeztéig, és teljes üzembe helyezést igényel meghibásodás esetén.
Aktív-passzív meleg készenléti állapot Egy DR üzembe helyezési minta, amelyben a másodlagos régióban néhány infrastruktúra előre üzembe van helyezve és csökkentett kapacitás mellett működik, lehetővé téve a gyorsabb feladatátvételt, mint a hideg készenléti állapot esetén.
Backup Az elsődleges rendszertől elkülönítve tárolt adatok másolata az adat-helyreállítás engedélyezéséhez, ha veszteség, sérülés vagy katasztrófa történik
Üzleti kritikusság A számítási feladatok vagy összetevők besorolása az üzleti műveletek szempontjából fontosságuk alapján, befolyásolva a helyreállítási prioritásokat és a befektetési szinteket.
DR aktiválási feltételek Előre definiált küszöbértékek és feltételek, amelyek meghatározzák, hogy mikor kell katasztrófa-deklarálni és helyreállítási eljárásokat aktiválni.
DR-részletezés Tervezett gyakorlat a vészhelyreállítási eljárások tesztelésére és a helyreállítási képességek ellenőrzött körülmények között történő ellenőrzésére.
Visszaállás A termelési terhelés forgalmának automatikus és/vagy manuális áthelyezése a kiesési régióból az elsődleges régióba.
Átállás A gyártási munkaterhelés forgalmának automatizált és/vagy manuális áthelyezése egy nem elérhető régióból egy nem érintett földrajzi régióba.
Időponthoz kötött helyreállítás Az adatok adott időpontra való visszaállításának képessége, amely általában az adatok sérüléséből vagy véletlen módosításokból való helyreállításra szolgál.
Helyreállítási pont célkitűzése (RPO) Az időben mért adatvesztés maximális elfogadható mennyisége, amely meghatározza, hogy egy vállalat mennyi adatvesztést engedhet meg magának egy katasztrófa során.
Helyreállítási idő célkitűzése (RTO) Az üzleti műveletek katasztrófa utáni visszaállításának maximális elfogadható ideje.
Szinkron replikáció Adatreplikálás, ahol a módosítások egyszerre több helyre íródnak, így nulla adatvesztés, de potenciálisan nagyobb késés érhető el.
Aszinkron replikáció Adatreplikálás, ahol a módosítások először az elsődleges helyre lesznek beírva, majd másodlagos helyekre másolódnak, ami némi adatvesztést, de kisebb késést tesz lehetővé.
Hadiszoba Egy központosított hely vagy kommunikációs csatorna, ahol a kulcsfontosságú személyzet koordinálja a vészhelyreállítási műveleteket.

Rangsorolás az üzleti hatás alapján

A számítási feladatokat a szervezet által meghatározott kritikussági szintek szerint kategorizálhatja, például kritikus fontosságú, üzleti szempontból kritikus, üzleti szempontból működőképes stb. Ismerje fel, hogy az egyes szintek különböző szintű befektetést, rugalmasságot és helyreállítási sorrendet biztosítanak. Ha a számítási feladat több folyamatot vagy összetevőt tartalmaz különböző kritikusságokkal, dokumentálja mindegyik helyreállítási megközelítését, hogy elkerülje a kétértelműséget egy esemény során.

Ezek a kritikussági szintek befolyásolják a megfelelő helyreállítási célkitűzéseket. A nagyobb kritikusságú összetevők gyorsabb helyreállítást és gyakoribb adatvédelmet igényelnek, míg az alacsonyabb kritikusságú összetevők lassabb helyreállítást képesek elviselni. Ezekből a követelményekből egyértelmű RTO- és RPO-célokat kell levezetni , amelyek közvetlenül az üzleti értékhez igazítják a helyreállítási elvárásokat.

Vészküszöbök definiálása

Győződjön meg arról, hogy a csapat és az üzleti érdekelt felek pontosan tudják, mi számít katasztrófaként, és mi nem. A stratégiának különbséget kell tennie a teljes katasztrófa, a jelentős fennakadások és a gyorsan javítható kis probléma között. Ne csak arra alapozza ezt, hogy mely összetevők hibásak. Ehelyett vegye figyelembe, hogy a probléma milyen hatással van a felhasználókra és az egész vállalkozásra.

Miután meghatározta azokat a küszöbértékeket, amelyek elválasztják a kisebb incidenseket a valódi DR-helyzetektől, építse be őket az állapotmodellbe. Így a monitorozás korai figyelmeztető jeleket észlelhet, és a megfelelő helyreállítási folyamatok aktiválódnak.

Kommunikációs protokollok létrehozása

Egyértelmű kommunikáció nélkül még a legjobban megtervezett vészhelyreállítási terv is széteshet. Hozzon létre egy egyértelmű kommunikációs stratégiát, amely meghatározza, hogy ki hozza meg a döntéseket, kik kapnak tájékoztatást, és hogyan áramlik az információ egy DR-esemény során.

Első lépésként vázolja fel a szerepköröket és a feladatokat a számítási feladatokat végző csapaton belül, valamint az érintett külső csoportokban. Ezek közé tartoznak a katasztrófa deklarációjának, az incidensek bezárásának, a műveleti feladatok futtatásának, a tesztelés és az ellenőrzés végrehajtásának, a belső és külső kommunikáció kezelésének, valamint a vezető visszatekintéseknek vagy a kiváltó okok elemzésének a tulajdonosai.

Részletes utasításokat adhat meg, felsorolhatja az összes előfeltételt (például szkripteket, hitelesítő adatokat és konfigurációkat), és meghatározhatja a csapat és a felhőszolgáltató közötti felelősségeket. Győződjön meg arról, hogy a helyreállítás megkezdése előtt elhárítják a kiváltó okokat, hogy megelőzzék az ismétlődő hibákat.

Többfunkciós hadiszobákat hozhat létre, hogy a megfelelő személyek gyorsan koordinálhassák egymást, és előre előkészítsék a kommunikációs csatornákat és üzenetsablonokat, hogy a csapatok ne improvizáljanak nyomás alatt.

Határozza meg azokat az eszkalációs útvonalakat, amelyeket a számítási feladatokért felelős csapatnak követnie kell annak biztosításához, hogy a helyreállítási állapotot közölje az érdekelt felekkel.

Helyreállításra felkészült architektúra tervezése

A vészhelyreállítási folyamatnak tükröznie kell a számítási feladat tervezésének módját, és ezzel szemben a helyreállítási követelményeknek a kezdetektől befolyásolnia kell az architekturális döntéseket. A rendszerek tervezésekor gondolja át, hogyan kíván vészhelyreállítást végezni, és válasszon olyan mintákat (például aktív-passzív hideg készenléti vagyaktív-passzív meleg készenléti), amelyek támogatják a helyreállítási követelményeket.

Az adat-helyreállításhoz használjon RPO-célokon alapuló replikációs stratégiákat. Például a magas prioritású adatok rendelkezésre állási zónáinak szinkronizálása, az alacsonyabb prioritású régiók közötti aszinkron módon. Győződjön meg arról, hogy a konzisztenciamodellek támogatják a helyreállítást, gyakori teljes biztonsági mentéseket és időponthoz kötött helyreállítást hajtanak végre, figyelembe veszik az adattárak közötti függőségeket, és automatizálják az integritás-ellenőrzéseket a helyreállítás során.

Megjegyzés:

Olyan feladatokat tervezhet elszigetelés és elkülönítés alkalmazásával, amelyek lehetővé teszik az egyes összetevők részleges feladatátvételét. Ez csökkenti a bonyolultságot, a költségeket és az RTO-t, és teljes katasztrófa bejelentése nélkül fenntarthatja a részleges rendelkezésre állást. A részleges feladatátvételeket külön tesztelje, és dokumentálja, hogy mikor kell őket aktiválni.

Infrastruktúra- és helyreállítási eljárások előkészítése

Előre készítse elő a másodlagos régiót. Hozzon létre egy ellenőrzőlistát, hogy a csapat készen álljon egy incidens bekövetkezésekor, például:

  • Számítási réteg: A meleg aktív/passzív számítási feladatokhoz előre üzembe kell helyeznie a minimális számítási erőforrásokat a gyors feladatátvétel támogatásához.
  • Hálózati infrastruktúra: Replikálja a topológiát, beleértve a virtuális hálózatokat, alhálózatokat, útvonalakat, tűzfalakat és biztonsági csoportokat, és erősítse meg az összes konfigurációt.
  • Identitás- és hozzáférés-kezelés: Duplikált fiókok beállítása, RBAC-engedélyek, és szabályzatok, amelyek ugyanazt a biztonsági alapkonfigurációt biztosítják, mint a termelési környezetben.
  • Monitorozás: Monitorozási infrastruktúra üzembe helyezése a láthatósághoz konfigurált riasztásokkal és irányítópultokkal.

A helyreállítási folyamatok rétegezése. Az összetevők, az adattulajdonságok és a számítási feladatok szintjén végzett struktúraeljárások. Határozza meg a megfelelő sorrendet a hatás minimalizálása érdekében. Például állítsa vissza az adatbázisokat a tőlük függő alkalmazások előtt. Hatókör meghatározása az üzleti hatás alapján. Döntse el, hogy mely környezetekhez, éles környezetekhez és szükség esetén nem éles környezetekhez van szükség dr. lefedettségre, figyelembe véve az ügyfelek hatását és költségeit.

A visszaállási stratégiát tartsa elkülönítve az átállástól.

Kockázat: A feladat-visszavétel szükségessége a helyzettől függ: ha például a forgalmat a teljesítmény érdekében átirányították a régiók között, fontos az eredeti régióba való visszaállítás. Más esetekben a számítási feladatok teljes mértékben működhetnek függetlenül attól, hogy melyik környezet aktív. Ha a feladat-visszavételt nem megkülönböztetett, jól definiált folyamatként kezelik a feladatátvételtől, a csapatok zavart tapasztalhatnak, ami hiányos helyreállításhoz vagy hosszan tartó állásidőhöz vezethet.

A kockázat csökkentése érdekében hozzon létre egy feladat-visszavételi tervet, hozza létre és tartsa karban a feladat-visszavételi tervet ugyanazokkal az alapelvekkel, mint a DR-terv, beleértve a feladatátvétel manuális lépéseinek tükrözését is. A visszaállítás azonnal vagy több napon, esetleg héten keresztül is történhet, de különálló folyamatként kell kezelni.

Tervezze meg az átváltás utáni munkát. Rögzítse a feladatátvétel után szükséges összes feladatot, például a DNS-frissítéseket, a forgalom útválasztását és a kapcsolati lánc módosítását a munkaterhelés teljes online állapotba helyezéséhez.

Robusztus biztonsági mentési stratégiák implementálása

Válassza ki az egyes Azure-szolgáltatásokra szabott biztonsági mentési megoldásokat, határozza meg a megőrzési időtartamokat, és ismerje fel, hogy egyetlen eszköz sem fed le mindent. Fontolja meg a többrégiós tárolást a régiók közötti helyreállíthatóság érdekében, és egyes erőforrások esetében használja a magas rendelkezésre állású adattárakból származó újratelepítést. A visszaállítások rendszeres tesztelése a biztonsági mentések ellenőrzéséhez, valamint a tervek rendszeres felülvizsgálatához és frissítéséhez, biztonságos tárolásához és a megfelelő csapatok számára való elérhetővé tételéhez.

Rendszeres gyakorlatokkal való gyakorlás

A DR-terv csak akkor hasznos, ha reális feltételek mellett érvényesítik. Teszteljen több forgatókönyvet, beleértve a peremes eseteket is, és kombinálja az ütemezett próbákat a meglepetés játéknapokkal, hogy lássa, hogyan reagálnak a rendszerek és a csapatok nyomás alatt.

A DR-tervben szerepeljen az asztali gyakorlatok eljárásainak és ütemének, a nem éles környezetben végzett száraz futtatásoknak és az éles szintű próbáknak az ütemezése. Az asztali gyakorlatok segítenek a csapatnak a szerepkörök gyakorlásában, az ismerkedés elősegítésében és az új tagok betanítására, míg a valós próbák az egyetlen módja annak, hogy a terv valós körülmények között elérje az RTO- és RPO-célokat. A kontrollon kívüli folyamatok, például a DNS propagálása esetén ellenőrizze a helyreállítási idő kiértékelése során esetleges késéseket.

Kockázat: A DR-próbák éles környezetben történő végrehajtása váratlan, potenciálisan súlyos hibákat okozhat. Először tesztelje a helyreállítási eljárásokat nem éles környezetekben, hogy ellenőrizze a biztonságot, és feltárja a problémákat, mielőtt éles környezetben futtatja a próbákat.

Legyen egy olyan folyamat, amely bemenetként kezeli a teszteredményeket a DR általános helyzetének javítása érdekében. Ha például egy új operátor tétovázik, tekintse át ezt az eljárást, hogy egyértelműen meg legyen írva.

Tesztelje és ellenőrizze mind az általános, mind az összetevőszintű RTO-t és az RPO-t a teljes katasztrófa-elhárítási gyakorlatoktól elkülönítve. Olyan forgatókönyveket is tartalmazhat, mint például az adatok régiók közötti áthelyezése vagy a hideg tárolóból való visszaállítás a célok elérése érdekében.

Tervek naprakészen tartása és végrehajthatóság

Kezelje a DR-tervet élő dokumentumként. A tervnek a környezet változásainak megfelelően kell fejlődnie, és minden érintett csapattal, üzemeltetéssel, technológiai vezetőséggel és üzleti érdekelt felekkel rendszeresen felül kell vizsgálni, ideális esetben hathavonta.

Tartsa a DR tervét összhangban az FMA dokumentációval, rögzítve, hogyan viselkedik a rendszer katasztrófa esetén és hogyan kell reagálni. Amikor új hibaeseteket fedez fel teszteléssel, monitorozással vagy valós incidensekkel, frissítse a tervet, hogy belefoglalja őket. Győződjön meg arról, hogy a DR-terv és az FMA dokumentációja is frissül, amikor a környezet változása vagy a tesztelés váratlan viselkedést fedez fel.

Az eljárások pontosítása az idő függvényében. A DR-eljárások korai szakaszában tegyük fel, hogy minden eljárásnak egymás után kell futnia, és további időt kell hagynia az előre nem látható problémákra. Ahogy a katasztrófa-helyreállítási gyakorlatok fejlődnek, azonosítsa, hogy mely lépéseket lehet biztonságosan párhuzamosan futtatni. A finomításnak az architektúra változásait is rögzítenie kell. Amikor a számítási feladatok architektúrája megváltozik, frissítse a DR-tervet, hogy egyértelműen meghatározza az aktiválási feltételek vagy helyreállítási folyamatok módosításait.

Tervezze meg a reális helyreállítási időket. A tesztelésből származó metrikákat használja a helyreállítási lépésekhez szükséges minimális időként a részletezések ütemezése során.

Akadálymentesség biztosítása a kimaradások során

A vészhelyreállítás csak akkor sikeres, ha a terv és a végrehajtáshoz szükséges eszközök is minden hibafeltétel mellett elérhetők maradnak.

A vészhelyreállítási dokumentációt, a szkripteket és a helyreállítási összetevőket magas rendelkezésre állású, biztonságos helyeken tárolhatja, így azok a regionális kimaradások során is elérhetők maradnak. Védje az összes DR-eszközt, beleértve a terveket, a hitelesítő adatokat, a tanúsítványokat és a szkripteket, és replikálja őket a régiók között. Offline vagy nyomtatott példányok megőrzése a legrosszabb esetekre. Minden régióban előre üzembe helyezheti a CI-/CD-folyamatokat, hogy szükség esetén azonnal fussanak.

Helyreállítási eljárások biztonságos automatizálása

Az üzembe helyezési és helyreállítási eljárások automatizálása feladatátvételi környezetekben, ahol csak lehetséges, biztosítva, hogy megfeleljenek az RTO-céloknak. Használjon deklaratív, idempotens szkripteket a megbízhatóság érdekében, és hozzon létre olyan védelmet, mint az újrapróbálkozási és a kapcsolatcsoport-megszakító logika bármely egyéni kódhoz. A DevOps-folyamatokat előre üzembe helyezheti és konfigurálhatja, hogy az üzembe helyezések azonnal elinduljanak, automatizált, teljes körű folyamatokat használva, manuális jóváhagyási kapukkal, csak szükség esetén. Győződjön meg arról, hogy az üzembe helyezési ütemtervek összhangban vannak a helyreállítási célokkal.

Szükség esetén manuális jóváhagyást alkalmazhat a sebesség vezérléssel való egyensúlyba hozásához. Ha manuális lépésekre van szükség, egyértelműen dokumentálja őket, és definiálja a szerepköröket és a felelősségeket.

Kockázat: Az automatizálás kockázatot jelent. A betanított operátoroknak még az automatizálással is felügyelniük kell a helyreállítási folyamatokat, és közbe kell avatkozniuk, ha problémák merülnek fel. Alapos DR próbákkal tesztelheti az összes fázist, érvényesítheti a helyreállítási célokat, és módosíthatja a feladatátvételi küszöbértékeket a hamis pozitív eredmények kockázatának csökkentése érdekében.

Az Azure megkönnyítése

Számos Azure-termék rendelkezik beépített feladatátvételi képességekkel. Ismerje meg ezeket a képességeket, és vegye fel őket a helyreállítási eljárásokba. Az Azure katasztrófa utáni helyreállítási adatkezelő platform program útmutatást nyújt a vállalati adatkészlet katasztrófa utáni helyreállítására való előkészítéséhez.

Az IaaS (szolgáltatásként szolgáló infrastruktúra) rendszerek esetében az Azure Site Recovery használatával automatizálhatja a feladatátvételt és a helyreállítást. A gyakori PaaS-termékekről az alábbi cikkekben olvashat:

Számos Azure-termék rendelkezik beépített biztonsági mentési képességekkel. Ismerje meg ezeket a képességeket, és vegye fel őket a helyreállítási eljárásokba.

Az IaaS (szolgáltatásként nyújtott infrastruktúra) rendszerek esetében az Azure Backup segítségével megkönnyítheti a virtuális gépek és a virtuális gépekhez kapcsolódó szolgáltatások, valamint egyes adatszolgáltatások biztonsági mentését. A gyakori termékekről az alábbi cikkekben olvashat:

Megbízhatósági ellenőrzőlista

Tekintse meg a javaslatok teljes készletét.