Provádění zmírnění rizik v agentovi Azure SRE

Váš agent diagnostikuje problémy a řeší je. Restartuje služby, škáluje prostředky, zpevní nastavení zabezpečení a shromažďuje diagnostiku, a to vše s úrovní kontroly, kterou zvolíte.

Návod

  • Požádejte svého agenta, aby problém vyřešil. Navrhuje řešení, schválíte ho a provede opravu.
  • Úplný záznam auditu: kdo ho aktivoval, co se změnilo a jestli fungoval.
  • Zvolte úroveň důvěryhodnosti: Režim kontroly (schválit každou akci) nebo autonomní režim (agent ji zpracuje).

Problém: diagnostika bez zásahu ztrácí čas

Identifikovali jste problém. Co teď? Přejdete na Azure portal, najdete správnou záložku, potvrdíte výběr prostředku, procházíte potvrzovacími dialogy, počkáte na dokončení operace a pak ověříte, že operace byla úspěšná. Vyšetřování trvalo pět minut. Oprava trvá dalších deset minut.

Toto tření existuje napříč provozními pracovními postupy:

  • Každodenní operace: Škálování prostředků pro očekávané zatížení, restartování služeb během údržby.
  • Kontroly souladu: Zpevnění bezpečnostních nastavení napříč desítkami úložných účtů.
  • Odpověď na volání: Rychle spusťte dobře známé opravy, aby se technici mohli vrátit do režimu spánku.
  • Proaktivní optimalizace: Upravte skladové položky na základě vzorů využití před výskytem problémů.

Jak váš agent uzavře okruh

Když váš agent identifikuje problém, nezastaví se tím, že vám řekne, co je špatně. Navrhuje konkrétní nápravnou akci a v závislosti na vašem režimu spuštění buď čeká na schválení, nebo akci provede okamžitě.

Agent se řídí konzistentním vzorem: diagnostikovat → identifikovat akce → kontrolovat oprávnění → provést (nebo navrhnout) → ověřit, jestli oprava fungovala. Každá akce se zaprotokoluje s tím, kdo ji aktivoval, co se změnilo, proč a jestli byla úspěšná.

Diagram znázorňující cesty odpovědí agenta: provedení opravy, vytvoření pracovní položky nebo odeslání oznámení

Po prošetření může váš agent provádět přímé akce, vytvářet položky sledování nebo informovat váš tým.

Čím se tento přístup liší od skriptů

Skripty jsou rigidní. Provádějí stejnou akci bez ohledu na kontext. Váš agent nejprve zdůvodní situaci. Bere v úvahu, co během vyšetřování našel, co si pamatuje z minulých incidentů a jaké vaše dovednosti a znalostní báze doporučují. Stejný indikátor může vést k restartování v jednom případě a zvětšení kapacity v jiném, protože se agent přizpůsobuje na základě důkazů.

Režimy spuštění poskytují odstupňovanou míru důvěry. Začněte v režimu kontroly , kde agent navrhuje a schvalujete. Přejděte na autonomní, jakmile si budete jistí vzorem. Používejte režim ReadOnly pro agenty určené výhradně pro monitorování, kteří nikdy neprovedou akci.

Co může váš agent dělat

Váš agent může provádět jakoukoli akci Azure prostřednictvím příkazů Azure CLI. Pokud ho můžete spustit v az, může ho spustit i váš agent. Tato funkce zahrnuje správu libovolného typu prostředku, úpravu konfigurací, vytváření prostředků a spuštění jakékoli operace Azure.

Typ příkazu Co umožňuje
Zpracování příkazů Dotazujte se na jakýkoli prostředek Azure – az webapp list, az containerapp show, az vm list, az network vnet show. Spustí se okamžitě, nevyžaduje se schválení.
Psaní příkazů Upravte libovolný prostředek Azure: az webapp restart, az containerapp update, az vm resize, az role assignment create. Vyžaduje schválení v režimu revize.

Akce agenta jsou omezené jenom oprávněními přiřazenými ke své spravované identitě. Pokud udělíte roli Přispěvatel na skupině prostředků, může váš agent spravovat vše v této skupině. Pokud udělíte vlastní roli s konkrétními akcemi, váš agent je omezený na tyto akce.

Bezpečnostní mantinely

Agent vynucuje bezpečnostní omezení na úrovni příkazu.

  • Operace smazání jsou blokovány: Agent nikdy nespustí příkazy delete a remove. Vrátí chybu, která uživatele nasměruje na portál Azure k odstranění.
  • Blokované příkazy služby Key Vault: Agent blokuje všechny az keyvault příkazy, aby se zabránilo odhalení přihlašovacích údajů.
  • Respektované zámky správy: Před úpravou jakéhokoli prostředku agent zkontroluje zámky Azure pro správu. Prostředky se zámky ReadOnly nelze upravit.
  • Ověření předplatného: Agent před spuštěním ověří ID předplatných v příkazech pro správný formát GUID.

Před a po

Následující tabulka porovnává proces ručního zmírnění rizik s přístupem s asistencí agenta.

před Po
Opravit spuštění Přejděte na Azure portal, vyhledejte prostředek, vyberte pomocí panelů. Zeptejte se agenta, schvalte, hotovo
Ověření Ruční kontrola, jestli oprava fungovala Agent ověřuje a hlásí výsledek.
Audit Doufám, že někdo zdokumentoval, co udělal Úplný záznam auditu ve službě Application Insights
znalost Jeden technik zná opravu. Agent konzistentně používá naučené vzory.

Požadavky na oprávnění

Ve výchozím nastavení mají agenti přístup jako čtenář a nemůžou vykonávat akce. Oprávnění k zápisu explicitně udělíte přiřazením rolí spravované identitě agenta.

Scope Na čem může agent reagovat Doporučeno pro:
zdroj Pouze jeden prostředek Maximální omezení. Začněte tady.
Skupina prostředků Všechny prostředky v jedné skupině Produkční úlohy
Subscription Jakýkoli zdroj v předplatném Pouze vývoj a testování

Výstraha

Agent nejprve zkontroluje zámky správy Azure, než upraví jakýkoli prostředek. Prostředky se zámky pouze pro čtení nemůžete upravovat bez ohledu na oprávnění nebo režim spuštění. Operace odstranění a odebrání jsou zablokované zcela. K odstranění můžete použít Azure Portal.

Alternativní cesty odpovědí

Přímá omezení rizik nejsou jedinou možností. Mnoho týmů dává přednost směrování zjištění do pracovních položek nebo systémů lístků místo přímého provádění akcí. Pracovní položky jsou užitečné zejména v případě, že je vyžadována lidská kontrola nebo se použijí procesy správy změn.

Cesta odpovědi Jak to funguje Nejvhodnější pro
Přímé zmírnění rizik Agent spustí restartování, škálování nebo posílení zabezpečení. Důvěryhodné vzory, neprodukční prostředí
Vytvoření pracovní položky Agent vytvoří problém s GitHubem nebo pracovní položku Azure DevOps Člověk ve smyčce, řízení změn
Odeslat oznámení Agent publikuje příspěvky do Teams nebo posílá e-maily Povědomí bez akce
Pracovní postup aktivace Agent spouští GitHub Actions nebo Logic Apps. Integrace CI/CD, vícekrokové procesy

Nakonfigurujte vytváření pracovních položek a oznámení prostřednictvím konektorů. Například připojte server MCP GitHub, aby váš agent mohl vytvářet požadavky, nebo připojte Azure DevOps k automatickému vytváření pracovních úkolů.

Další informace najdete v tématu Odesílání oznámení a automatizace pracovních postupů pro zřetězování těchto typů odpovědí.

Příklad: Zmírnění rizik aktivované incidentem

Následující příklad ukazuje, jak váš agent zpracovává incident paměti ve 3:47, zatímco spíte.

3:47 dopoledne: PagerDuty aktivuje výstrahu: "Vysoké využití paměti na prod-api"

Váš agent (v režimu revize) zpracovává všechno:

  1. Oznamuje uznání incidentu: PagerDuty zobrazuje "Uznáno agentem SRE."

  2. Prošetřuje se automaticky:

    • Dotazy App Insights: paměť na 94%, stoupá za poslední 2 hodiny.
    • Kontroluje historii nasazení: žádné nedávné nasazení.
    • Vzpomíná si: "Když se to naposledy stalo, vyřešil to restart."
  3. Navrhuje opravu: Příspěvky do vlákna incidentu:

    Memory at 94% on prod-api (App Service).
    Recommended action: Restart the App Service.
    
    Evidence:
    - Memory climbing since 1:30 AM
    - No recent deployments
    - Past incident: restart resolved similar issue on 2026-01-15
    
    [Approve] [Deny]
    
  4. Schválíte (nebo v autonomním režimu se agent spustí okamžitě).

  5. Agent se spustí a ověří:

    ✓ Restarted prod-api
    ✓ Memory now at 42%
    ✓ Incident resolved
    

Co se přihodilo: Vybrali jste možnost Schválit a agent zpracoval šetření, akci a ověření.

Revizní záznam

Systém zaznamenává každou akci zmírnění rizik spolu s úplným kontextem.

Pole Zachycené informace
Identita Agent a spravovaná identita
Action Přesná provedená operace
Časová značka Po dokončení operace
Spouštěč Diagnostika nebo stav, který vedl k akci
Výsledek Úspěch nebo selhání s ověřením po akci

Záznam auditu v Application Insights můžete prohledávat prostřednictvím Monitorovacích protokolů > na portálu agenta. Systém protokoluje každý az příkaz jako AgentAzCliExecution vlastní událost. Další informace najdete v tématu Akce agenta auditu.

Začínáme

Omezení rizik fungují automaticky s integrovaným nástrojem Azure CLI. Můžete řídit, kolik autonomií má váš agent prostřednictvím režimů spuštění.

zdroj Co se naučíte
Nastavení plánu reakce Konfigurace plánů reakcí, které zahrnují automatizované zmírnění rizik
Režimy spuštění Konfigurujte úrovně spouštění jen pro čtení, hodnocení nebo autonomní.

Další krok