Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Azure Chaos Studio je spravovaná služba, která pomáhá ověřit odolnost aplikací Azure vložením kontrolovaných přerušení, jako je vypnutí virtuálních počítačů, vynucení převzetí služeb při selhání databáze a blokování překladu DNS. Pomocí Chaos Studio můžete reprodukovat skutečné vzory výpadků, ověřit, že mechanismy obnovení fungují, a vytvářet důkazy, že vaše systémy zpracovávají selhání bez problémů.
Pracovní prostory a scénáře
Nejrychlejší způsob, jak začít, je pracovní prostor. Pracovní prostor se připojí k vašemu Azure prostředí prostřednictvím oboru (předplatného, skupiny prostředků nebo skupiny služeb), zjistí nasazené prostředky a doporučí scénáře, které simulují skutečné vzorce výpadků těchto prostředků.
Pracovní prostory jsou flexibilní. Můžete je uspořádat tak, aby vyhovovaly vašemu týmu: vytvořte jeden pracovní prostor na aplikaci, jeden na prostředí (předprodukční vs. produkční), jeden na tým nebo jeden na hranici dodržování předpisů. Rozsah určuje, které zdroje Pracovní prostor vidí, takže na úrovni Pracovního prostoru řídíte rozsah dopadu.
Každý scénář je předkonfigurovaný test odolnosti. Místo ručního skládání jednotlivých akcí vyberete scénář, například Výpočetní zóna mimo provoz nebo Výpadek DNS, a Chaos Studio zajistí skládání akcí, vyhledání prostředků a jejich sekvenování. Po dokončení běhu získáte zprávu o scénáři, strukturovaný záznam o tom, co se stalo, který můžete použít pro účely souladu s předpisy, retrospektivy nebo komunikaci se zúčastněnými stranami.
Dostupné scénáře pokrývají výpadky zón a síťového připojení, přepnutí při selhání databáze, zahlcení mezipaměti a narušení zasílání zpráv. Pokud předdefinované šablony nevyhovují vašim potřebám, použijte návrháře scénářů k přizpůsobení šablony do vlastního uloženého scénáře. Úplný katalog najdete v Scénáře v Azure Chaos Studio.
Pokud chcete vytvořit první pracovní prostor a spustit scénář, přečtěte si článek Rychlý start: Vytvoření pracovního prostoru a spuštění prvního scénáře.
Experimenty (klasické)
Pro vlastní kombinace poruch, které katalog scénářů nepokrývá, vytvořte experimenty přímo. Experimenty poskytují úplnou kontrolu nad kroky, větvemi, akcemi, cíli a selektory. Tento model je původní Chaos Studio model a stávající experimenty budou fungovat stejně jako předtím.
Chaos Studio podporuje dva typy chyb:
- Service-direct: Poruchy, které probíhají přímo na prostředku Azure prostřednictvím jeho rozhraní API pro správu, bez nutnosti použití agenta. Mezi příklady patří vypnutí virtuálního počítače, vyvolání převzetí služeb při selhání databáze SQL nebo vyprázdnění mezipaměti Redis.
- Na bázi agenta: Poruchy, které běží uvnitř virtuálního počítače nebo škálovací sady virtuálních počítačů, aby vyvolaly selhání v hostovaném systému, například zátěž procesoru, zátěž paměti nebo ukončení procesu.
Každá chyba má specifické parametry, které můžete nakonfigurovat. Při vytváření experimentu definujete jeden nebo více kroků , které se spouštějí postupně. Každý krok obsahuje jednu nebo více větví , které běží paralelně. Každá větev obsahuje jednu nebo více akcí, například vložení chyby nebo čekání na zadanou dobu trvání.
Návod k modelu experimentu najdete v tématu Chaos experimenty v Azure Chaos Studio.
plugin Chaos Studio AI
Modul plug-in Chaos Studio AI (startchaos) umožňuje vytvářet pracovní prostory, konfigurovat scénáře, spouštět je a analyzovat výsledky prostřednictvím konverzačního rozhraní. Modul plug-in funguje jako interaktivní dovednost pro GitHub Copilot CLI i jako server MCP (Model Context Protocol), který můžou volat autonomní agenti.
Po dokončení běhu scénáře nástroj modulu plug-inu pro analýzu dopadu koreluje metriky, protokoly a události protokolu aktivit služby Azure Monitor s cílovými prostředky, takže můžete vidět, které signály se během testu změnily, aniž byste museli řídicí panely vytvářet ručně.
Pokyny k nastavení a kompletní referenční informace o nástrojích najdete v úložišti modulu plug-in Chaos Studio.
Kdy použít Chaos Studio
Chaos Studio zapadá do několika bodů životního cyklu vývoje a provozu:
- Reprodukce incidentů: Po výpadku reprodukujte model selhání a ověřte, že vaše opravy zlepšují odolnost.
- Herní dny: Před hlavní událostí spusťte scénáře v produkčním nebo předprodukčním prostředí, abyste ověřili, že vaše systémy zpracovávají očekávané režimy selhání.
- Testování provozní kontinuity: Ověřte chování převzetí služeb při selhání a časové cíle obnovení pro plány zotavení po havárii.
- Průběžná validace: Spouštějte scénáře nebo experimenty jako brány nasazení v CI/CD pipelinech, abyste zachytili regrese odolnosti dříve, než se dostanou do produkce.
- Důkazy o dodržování předpisů: Použití sestav scénářů k podpoře požadavků na důkazy pro architektury provozní odolnosti, jako je DORA.
Následující video poskytuje další pozadí o Chaos Studiu:
Hlášení problémů a žádostí o funkce
Azure Chaos Studio se vyvíjí v otevřeném prostředí. Pokud chcete nahlásit chybu, požádat o funkci nebo položit dotaz týkající se pracovních prostorů, scénářů nebo rozšíření Azure CLI, otevřete problém v úložišti Chaos Studio na GitHub. Nahlášením problému můžete sledovat jeho stav a zobrazit požadavky od dalších zákazníků.