Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
V cloudových prostředích jsou selhání nevyhnutelné. K hardwarovým chybám, chybám softwaru, chybám konfigurace, špičkám provozu, výpadkům datového centra a dokonce k výpadkům v celé oblasti může dojít. Spolehlivost je schopnost úlohy udržovat obchodní očekávání, a to i při selháních nebo přerušeních. Se správnou architekturou a provozem nemusí selhání vést k výpadkům.
Neplánované výpadky můžou mít velký dopad. Nese finanční náklady a škody zákazníka a důvěru uživatelů. Kromě těchto okamžitých dopadů má nízká spolehlivost vliv na závazky dodržování předpisů a konkurenční postavení. Vaše týmy tráví více času hasiči a méně času doručují hodnotu. Může dokonce aktivovat sankce na úrovni smluvních služeb.
Azure poskytuje odolnou infrastrukturu a spravované služby, ale spolehlivost vašich úloh závisí na návrhu a provozních rozhodnutích, která uděláte: způsob návrhu architektury, konfigurace služeb, správa závislostí, automatizace reakcí na problémy a testování softwaru a procesů. Návrh pro včasnou spolehlivost pomáhá minimalizovat chyby a zajistit, aby se vaše úlohy v případě jejich výskytu snížily předvídatelným a řízeným způsobem, který je v souladu s obchodními prioritami.
Spolehlivá úloha má dvě základní vlastnosti:
- Je odolný, což znamená, že může absorbovat selhání a změny v prostředí a současně nadále fungovat na přijatelné úrovni služby.
- Je také obnovitelné, což znamená, že když dojde k přerušení, může úloha obnovit normální operace v rámci definovaných časových limitů a limitů ztráty dat.
Potřebujete obě vlastnosti, abyste splnili očekávání o dostupnosti z reálného světa a zachovali provozní kontinuitu.
Spolehlivost v Azure funguje napříč třemi vzájemně propojenými vrstvami:
- Vaše aplikace: Vaše volby architektury, postupy a procesy, včetně správy závislostí, runbooků, automatizace a testování
-
Funkce spolehlivosti, mezi které patří:
- Služby úloh a konfigurace: Jak nakonfigurujete služby Azure, které spouští vaši úlohu, a možnosti spolehlivosti, které nakonfigurujete v rámci těchto služeb.
- služby platformy Azure: Azure služby, které konkrétně podporují spolehlivost úloh, jako je vyrovnávání zatížení, DNS, směrování provozu a monitorování
- Základy spolehlivosti: integrovaná odolnost Azure, jako jsou zóny dostupnosti, oblasti a postupy bezpečného nasazení
Tyto vrstvy spolupracují na určení celkové spolehlivosti úloh. Pochopení vám pomůže rozlišit, co Azure ve výchozím nastavení poskytuje, a to, co potřebujete k návrhu, konfiguraci a provozu.
Tento model vám pomůže využít to, co Azure poskytuje, a zároveň zodpovídá za to, co můžete navrhnout jenom vy. Tento článek se zaměřuje na to, co Azure poskytuje napříč těmito vrstvami. Komplexní pokyny k návrhu úloh a provozní vrstvě (navrhování odolných řešení a vzorů architektury) najdete v Azure Well-Architected Frameworku a zejména pilíři spolehlivosti.
Sdílená odpovědnost za spolehlivost
Spolehlivost v Azure se řídí modelem sdílené odpovědnosti. Microsoft poskytuje odolnou platformu prostřednictvím Azure. Navrhujete odolné úlohy.
Microsoft vlastní základy platformy a služby pro spolehlivost platforem. Toto vlastnictví zahrnuje odolnou infrastrukturu (fyzickou redundanci, izolaci chyb a opravy), zóny dostupnosti, regionální distribuci, postupy bezpečného nasazení a služby na úrovni platformy, jako je vyrovnávání zatížení, směrování provozu a monitorování. Microsoft zodpovídá za spolehlivost platformy Azure a spolehlivost služeb definovaných publikovanou smlouvou SLA a dokumentací, jako je jejich průvodce spolehlivostí.
Vlastníte návrh a provoz úloh. Zodpovídáte za překlad funkcí Azure do spolehlivého chování úloh prostřednictvím rozhodnutí o architektuře, možností konfigurace, provozních postupů a testování.
Azure nemůže znát vaše cíle dostupnosti, přijatelné kompromisy, obchodní kontext nebo požadavky specifické pro aplikaci. Tyto požadavky a návrh můžete definovat pouze vy. Azure poskytuje možnosti, když je vyberete a nakonfigurujete. Například nakonfigurujete chování převzetí služeb při selhání pro služby, jako jsou databáze, a definujete sondy stavu nástroje pro vyrovnávání zatížení, které přesně představují stav aplikace, aby rozhodnutí o směrování provozu byla správná i během selhání.
Důležité
Platforma poskytuje stavební bloky, nikoli kompletní záruky. Vaše možnosti návrhu a provozu určují, jestli se tyto funkce překládají na spolehlivou úlohu. Úplný rozpis modelu sdílené odpovědnosti najdete v tématu Sdílená odpovědnost v cloudu.
Smlouvy o úrovni služeb (SLA) definují závazky a očekávání spolehlivosti napříč službami Azure. Pochopení smluv SLA je nezbytné při vyhodnocování služeb a navrhování pro konkrétní cíle dostupnosti. Azure služby publikují závazky sla, které se můžou lišit podle úrovně konfigurace a redundance. Další služby, které používáte od jiných poskytovatelů, můžou také publikovat smlouvy SLA. Komplexní pokyny týkající se fungování smluv SLA a jejich vztahu k očekáváním dostupnosti vašich úloh najdete v tématu Smlouvy o úrovni služeb.
Odolné základy v Azure
Azure je navržená s několika vrstvami odolnosti, která je integrovaná do samotné platformy. Tyto základy poskytují základní možnosti, na kterých se vytvářejí spolehlivé úlohy:
Odolnost fyzické infrastruktury: Azure datacentra jsou navržena s redundantní infrastrukturou, jako je napájení, chlazení a síťové připojení. Kontroler prostředků infrastruktury Azure automaticky izoluje a spravuje selhání hardwaru. Detekuje chyby a orchestruje migraci úloh na hardware, který je v pořádku bez zásahu zákazníka.
Oblasti: Azure působí ve více než 70 oblastech po celém světě. Tato geografická distribuce umožňuje úlohám odolat výpadkům a výpadkům v celé oblasti prostřednictvím plánovaných možností převzetí služeb při selhání a přitom sledovat požadavky na rezidenci dat. Další informace najdete v přehledu Azure oblastí.
Zóny dostupnosti: Mnoho Azure oblastí zahrnuje fyzicky oddělená datacentra ve stejné oblasti. Tyto zóny dostupnosti jsou propojeny vysokorychlostními sítěmi s nízkou latencí. Každá zóna má nezávislé napájení, chlazení a sítě, které chrání před selháním na úrovni datacentra a současně zachovává synchronní možnosti replikace pro mnoho služeb Azure. Další informace najdete v tématu Co jsou zóny dostupnosti?
Bezpečná nasazení: Azure implementuje řízené a rozložené procesy nasazení pro aktualizace platformy a změny služeb, aby se minimalizovalo riziko rozsáhlého přerušení služeb. Platforma postupně zavádět aktualizace, například napříč doménami selhání, zónami dostupnosti a oblastmi, s automatizovanými možnostmi vrácení zpět při zjišťování problémů. Tento přístup zajišťuje, že změny platformy nezavádějí rizika spolehlivosti pro úlohy zákazníků.
Azure tyto základy na úrovni platformy poskytují automaticky. Tvoří základní vrstvu, na které vytváříte spolehlivé úlohy. Přesto ale musíte služby správně nakonfigurovat a kombinovat tyto funkce způsoby, které splňují vaše konkrétní obchodní požadavky.
Azure služby, které podporují vaši spolehlivost
Azure poskytuje funkce platformy, které překládají koncepty spolehlivosti do stavebních bloků pro vaši architekturu s možností použití. Tyto funkce spolupracují a umožňují odolné architektury a mnoho Azure služeb zahrnuje integrované implementace těchto vzorů:
| Capability | Description |
|---|---|
|
|
Používá funkce řízené AI k vyhodnocení a zlepšení spolehlivosti. Tyto funkce analyzují vzory úloh, identifikují potenciální rizika a poskytují doporučení, která týmům pomůžou přejít z reaktivního řešení potíží na proaktivní správu spolehlivosti. Tyto funkce umožňují zvyšovat spolehlivost signálů a překládat je do použitelných doporučení, která týmům pomáhají určit prioritu a zlepšit spolehlivost v průběhu času. Azure poskytuje několik služeb spolehlivosti řízených AI, mezi které patří: - možnosti odolnosti Azure - Možnosti odolnosti v agentech (Preview) v Azure Copilot - Azure agentA SRE Tyto služby analyzují vzory úloh a navrhují vylepšení pro optimalizaci stavu spolehlivosti na celé desce. |
|
|
Umožňuje spolehlivost směrováním provozu mezi redundantními instancemi a automatickým zpracováním převzetí služeb při selhání. Tato funkce je nezbytná pro zachování dostupnosti služeb v případě selhání jednotlivých komponent. Azure poskytuje vyrovnávání zatížení ve více vrstvách, včetně: - Azure Load Balancer pro distribuci provozu TCP/UDP vrstvy 4 - Azure Application Gateway pro směrování HTTP vrstvy 7 s využitím kontrol stavu pracujících s aplikací - Azure Front Door pro globální vyrovnávání zatížení HTTP s rychlým převzetím služeb při selhání - Azure Traffic Manager pro globální distribuci koncových bodů založených na DNS Pokud potřebujete pomoc s rozhodováním, který nástroj pro vyrovnávání zatížení pro váš scénář použít, podívejte se na možnosti vyrovnávání zatížení. |
|
|
Chrání před ztrátou a poškozením dat a umožňuje obnovení po výskytu problému. Azure poskytuje několik možností zálohování a obnovení, mezi které patří: - Azure Backup pro centralizované zálohování s konfigurovatelným uchováváním pro virtuální počítače, kontejnery objektů blob, soubory a některé databáze – Nativní funkce zálohování a obnovení v mnoha Azure službách, včetně většiny databázových služeb - Bicep a další infrastrukturu jako nástroje kódu pro zálohování konfigurace, ochranu odchylek a rychlé obnovení prostředí Projděte si průvodce spolehlivostí každé služby Azure a seznamte se s přístupy zálohování, které služba podporuje. |
|
|
Umožňuje obnovení z oblastních selhání prostřednictvím replikace dat mezi oblastmi a automatizovaných funkcí převzetí služeb při selhání. Azure Site Recovery orchestruje zotavení po havárii pro úlohy virtuálních počítačů pomocí automatizované replikace a sekvencování převzetí služeb při selhání. Mnoho služeb Azure také poskytuje integrované funkce geografické replikace, mezi které patří: - Azure Cosmos DB s nativní replikací dat mezi oblastmi a možnostmi převzetí služeb při selhání - Azure API Management s nativními funkcemi převzetí služeb při selhání mezi oblastmi Průvodci spolehlivostí služeb podrobně uvádějí všechny možnosti geografické replikace dostupné pro každou službu. |
|
|
Poskytuje komplexní přehled o stavu spolehlivosti a umožňuje proaktivní reakci na problémy. Azure poskytuje několik služeb pozorovatelnosti, mezi které patří: - Azure Monitor a Application Insights pro monitorování, upozorňování a sledování závislostí v reálném čase - Modely stavu v Azure Monitor pro monitorování stavu celé úlohy - Azure Service Health pro přizpůsobené výstrahy a pokyny pro problémy se službou Azure, které můžou ovlivnit vaše úlohy Tyto funkce vám společně pomůžou pochopit, jestli splňujete požadavky na spolehlivost a rychle reagujete, když dojde k problémům. |
|
|
Pomáhá ověřit, že se úlohy chovají podle očekávání za podmínek selhání, a pomáhá zajistit, aby vaše řešení splňovalo požadavky na spolehlivost, než problémy ovlivní uživatele. Azure poskytuje služby pro testování spolehlivosti, mezi které patří: - Azure Chaos Studio pro řízené experimenty injektáže chyb za účelem ověření chování a odolnosti proti chybám v reálném světě - Testování aplikací Azure pro testování výkonu a funkčního testování, abyste pochopili, jak se aplikace chovají, včetně stresu |
Povolení spolehlivosti ve službách Azure
Platforma poskytuje možnosti spolehlivosti vrstvy služeb prostřednictvím desítek Azure služeb, z nichž každá má konkrétní silné stránky a případy použití. Průvodce spolehlivostí každé služby poskytuje podrobnosti o tom, jak může služba zůstat dostupná v různých scénářích, například:
- Přechodné chyby, což jsou krátká přerušovaná selhání. Průvodci službami poskytují doporučení k osvědčeným postupům, které minimalizují jejich dopad, například opakování a používání sad SDK poskytovaných Microsoft.
- Selhání zóny dostupnosti, aby služba automaticky přesměrovává požadavky, aby zachovala vysokou dostupnost.
- Selhání v celé oblasti, aby služba při selhání převzala sekundární oblast a pokračovala v provozu během přerušení oblasti.
Pokud chcete zobrazit průvodce spolehlivostí pro mnoho služeb Azure, přečtěte si příručky pro spolehlivost podle služeb.
Návrh spolehlivých úloh
Spolehlivost vychází z průběžného cyklu definování cílů, navrhování pro selhání a rychlé obnovení, testování předpokladů a zlepšování prostřednictvím provozního učení. Pomocí příruček pro Azure Well-Architected Framework a spolehlivost služeb můžete zjistit, co každá služba ve výchozím nastavení poskytuje a co vyžaduje explicitní konfiguraci. Strukturovaný přístup k implementaci spolehlivosti najdete v modelu vyspělosti Azure Well-Architected Frameworku.
Při návrhu propojte základní koncepty s technickými koncepty. Základní koncepty, jako je kontinuita podnikových procesů a sdílená odpovědnost , definují, jaké výsledky potřebujete k dosažení. Technické koncepty, jako je redundance, replikace, zálohování, převzetí služeb při selhání a navrácení služeb po obnovení , definují způsob implementace těchto výsledků ve vaší architektuře a operacích. Smlouvy o úrovni služeb vám pomůžou pochopit záruky, které obdržíte od poskytovatelů služeb.
Suverenita a umístění dat
Při návrhu spolehlivosti zahrňte požadavky na suverenitu a rezidenci dat včas, protože ovlivňují výběr oblasti, strategii replikace a cesty převzetí služeb při selhání. Odolná architektura stále nemusí splňovat požadavky na dodržování předpisů, pokud přepnutí při selhání nebo přesun dat překročí omezené hranice. Další informace naleznete v tématu Spolehlivost a suverenita.
Spolehlivost v Azure se dosahuje kombinováním odolných základů platformy s promyšleným návrhem a provozem úloh. Když pochopíte, co Azure poskytuje a kde potřebujete učinit rozhodnutí o návrhu a konfiguraci, můžete vytvářet systémy, které budou dál splňovat obchodní očekávání, a to i v případě selhání.