Krok 4: Nastavení reakce na incidenty v agentovi Azure SRE

Odhadovaný čas: 10 minut

Připojte platformu incidentů a vytvořte plán reakce. Když dorazí incidenty, váš agent je automaticky analyzuje a vygeneruje podrobné plány realizace.

Čeho dosáhnete

Na konci tohoto kroku váš agent:

  • Přijímá incidenty z Azure Monitoru, PagerDuty nebo ServiceNow.
  • Automaticky prošetřuje odpovídající incidenty.
  • Vygeneruje plány provádění AI z vašich pokynů.
  • Shromažďuje důkazy a poskytuje doporučení.

Předpoklady

Požadavek Podrobnosti
Agent vytvořen Dokončete krok 1: Nejprve vytvořte agenta.
Platforma incidentů Azure Monitor (výchozí), PagerDuty nebo ServiceNow

Návod

I když to není nutné, dokončení kroku 2: Přidání znalostí a kroku 3: Připojení zdrojového kódu výrazně zvyšuje reakci na incidenty. Váš agent čerpá z runbooků a spojuje problémy s konkrétními změnami kódu, čímž přeměňuje obecné šetření na týmově specifickou analýzu příčin.

Připojte svou platformu pro správu incidentů

Zvolte a nakonfigurujte platformu incidentů, která váš tým používá.

Azure Monitor (výchozí)

Azure Monitor se automaticky připojí při vytváření agenta. Není potřeba žádná další konfigurace.

PagerDuty nebo ServiceNow

Připojit PagerDuty nebo ServiceNow jako platformu pro incidenty:

  1. Na levém bočním panelu vyberte Nastavení .
  2. Vyberte platformu incidentů.
  3. V rozevíracím seznamu vyberte svou platformu:
    • PagerDuty: Zadejte přístupový klíč rozhraní REST API.
    • ServiceNow: Zadejte adresu URL instance a přihlašovací údaje.
  4. Vyberte Uložit.

Váš agent teď přijímá incidenty z vaší platformy.

Vytvoření reakčního plánu

Vytvořte plány odpovědí na plátně Subagent builder. Uvidíte, které triggery směrují k jakým subagentům.

  1. V levém postranním panelu vyberte Builder.
  2. Vyberte Tvůrce subagenta.
  3. Najděte podagenta, kterého chcete řešit incidenty, a vyberte tlačítko + na jeho levé straně.
  4. Vyberte Přidat spouštěč incidentu.
  5. Nakonfigurujte trigger: nastavte název, vyberte úrovně závažnosti (například P1 a P2), zvolte ovlivněnou službu a volitelně přidejte filtr klíčových slov nadpisu.
  6. Zvolte úroveň autonomie (například doporučujeme Recenze).
  7. Zobrazte náhled odpovídajících incidentů a pak vyberte Vytvořit.

Váš trigger se zobrazí jako uzel připojený k podagentu na plátně.

Important

Při prvním připojení platformy incidentů se automaticky vytvoří výchozí plán rychlé reakce. Pokud vytvoříte vlastní plány odpovědí, plán rychlého spuštění poběží souběžně s nimi a může způsobit, že incidenty budou směrovány nesprávnému vlastnímu agentovi nebo zpracovány dvakrát. Pokud se chcete vyhnout konfliktům, přejděte doplánů reakce na incidenty>, přepněte do zobrazení tabulky a odstraňte plán rychlého startu.

Úplného průvodce krok za krokem se snímky obrazovky najdete v tutoriálu Nastavení spouštěče incidentu.

Plány odpovědí zobrazené na plátně nástroje pro tvorbu podagentů

Co se stane, když dojde k incidentu

Když incident odpovídá vašemu plánu, agent ho zpracuje automaticky.

  1. Načte podrobnosti incidentu z vaší platformy.
  2. Vyhledá paměť pro podobné minulé incidenty a příslušnou dokumentaci.
  3. Spustí plán spuštěním příkazů a shromažďováním důkazů.
  4. Shrnuje závěry pomocí časových razítek a doporučení.

Vyhledávání v paměti zobrazující minulé incidenty a příslušnou dokumentaci

Ukázková zjištění

Následující příklad ukazuje zjištění incidentu aplikace kontejneru:

Shrnutí:

  • Kontejner byl restartován kolem 01:27Z a paměť klesla prudce.
  • Aktuální konfigurace: 2 Gi paměti, 1 PROCESOR, minReplicas=2, maxReplicas=4.

Pravděpodobná příčina: Přechodné restartování kontejneru (OOM nebo během nasazování)

Doporučené akce:

  1. Zvyšte hodnotu minReplicas na 3 až 4, abyste snížili dopad na restartování.
  2. Zkontrolujte sondy pro sledování stavu kontejneru.

Váš agent poskytuje užitečná doporučení založená na důkazech, nikoli obecných radách.

Další krok