Vytvoření plánu reakce na incidenty v agentovi Azure SRE

Plány reakcí přiřazují příchozí incidenty správnému vlastnímu agentovi na základě vámi definovaných kritérií filtru. V tomto kurzu v pracovním prostoru agenta vytvoříte plán reakce, zobrazíte si náhled incidentů, se kterými se shoduje, a pomocí přepínače povolit/zakázat určíte, kdy bude aktivní.

Předpoklady

  • Agent s připojenou platformou incidentů (PagerDuty, ServiceNow nebo Azure Monitor)
  • Nakonfigurovaný aspoň jeden vlastní agent
  • Role přispěvatele nebo vlastníka prostředku agenta

Krok 1: Otevřete plátno agenta

Na portálu agenta SRE vyberte svého agenta. Na levém bočním panelu přejděte na TvůrcePlátno agenta.

Important

Při prvním připojení platformy incidentů se automaticky vytvoří výchozí plán rychlé reakce. Pokud vytvoříte vlastní plány odpovědí, plán rychlého spuštění poběží souběžně s nimi a může způsobit, že incidenty budou směrovány nesprávnému vlastnímu agentovi nebo zpracovány dvakrát. Pokud se chcete vyhnout konfliktům, přejděte doplánů reakce na incidenty>, přepněte do zobrazení tabulky a odstraňte plán rychlého startu.

Krok 2: Vytvoření nového plánu odezvy

Na plátně agenta vyberte na panelu nástrojů možnost Vytvořit. Vyberte Aktivovat>plán reakce na incidenty.

Otevře se dialogové okno pro vytvoření.

Vyplňte kritéria filtru. Pole, která vidíte, závisí na vaší platformě incidentů:

  • Název plánu reakce na incidenty: Zadejte popisný název, například high-sev-api-trigger.

Pro Azure Monitor:

  • Závažnost: Vyberte jednu nebo více úrovní závažnosti.

  • Nadpis obsahuje (volitelné): Přidejte klíčové slovo pro další zúžení shod.

Pro PagerDuty / ServiceNow:

  • Ovlivněná služba: Vyberte službu, na které se tento plán vztahuje, nebo vyberte Vše.

  • Typ incidentu: Zvolte klasifikaci incidentu nebo vyberte Všechny typy incidentů.

  • Priorita: Vyberte jednu nebo více úrovní priority, například P1 a P2.

  • Nadpis obsahuje (volitelné): Přidejte klíčové slovo pro další zúžení shod.

Zvolte konfiguraci odpovědi:

  • Vlastní agent pro reakci: Vyberte vlastního agenta, který zpracovává shodující se incidencí.

  • Úroveň samostatnosti agenta: Zvolte, jak váš agent reaguje:

    • Autonomní (výchozí):: Váš agent nezávisle prošetřuje a provádí zmírnění rizik.
    • Kontrola: Váš agent navrhuje akce ke schválení před provedením.

Poznámka:

Když vyberete Autonomní (Výchozí),ℹzobrazí se vedle možnosti ikona ️ Vyberte ho, pokud chcete zkontrolovat potvrzení autonomního režimu, které shrnuje, co znamená autonomní spouštění, včetně hranic agentů, omezení modelu AI a vašich zodpovědností. Podrobnosti najdete v potvrzení autonomního režimu .

Návod

Pokud chcete před udělením úplné samostatnosti ověřit chování vašeho agenta při vyšetřování, začněte režimem kontroly nových plánů. Nové plány se ve výchozím nastavení nastavují jako autonomní.

Konfigurace doby pro opětovné prověření výstrah (pouze Azure Monitor)

Pokud je vaše platforma incidentů Azure Monitor, pod úrovní autonomie se zobrazí oddíl Po ochlazení pro opětovné vyšetření:

  • Povolit (zaškrtávací políčko, výchozí nastavení: zapnuto): Pokud je povoleno, opakované aktivace stejného pravidla upozornění během ochlazovací doby se spojí do stávajícího vlákna šetření místo spuštění nového. Vyřešená vlákna v okně se znovu otevřou.

  • Čas vychladnutí (číselník, výchozí hodnota: 3 hodiny, rozsah: 1 až 24): Jak dlouho po vyřešení nebo uzavření vlákna musí uplynout, než nový incident zahájí nové šetření místo opětovného otevření existujícího vlákna.

U většiny pravidel upozornění ponechte výchozí hodnoty. Zakažte cooldown jenom pro kritické výstrahy, u kterých každý požár vyžaduje nezávislé šetření.

Výstraha

Zakázání cooldownu může výrazně zvýšit spotřebu tokenů pro hlučná pravidla upozornění. Pravidlo, které se aktivuje každých 5 minut, by pokaždé vytvořilo nové šetření.

Vyplňte všechna povinná pole: název plánu, ovlivněná služba, typ incidentu a alespoň jedna úroveň priority. Tlačítko Další se aktivuje.

Krok 3: Náhled odpovídajících incidentů

Vyberte Další. Náhled incidentů zobrazuje tabulku minulých incidentů, které odpovídají vašim kritériím filtru.

Zobrazí se tabulka:

  • Priorita, datum vytvoření, název, ID incidentu a stav pro každý odpovídající incident
  • Filtr na časové rozmezí. Výchozí je Poslední 90 dní pro většinu platforem pro incidenty a Posledních 30 dní pro Azure Monitor.

Zkontrolujte výsledky:

  • Příliš mnoho shod? Vraťte se zpět a přidejte omezení závažnosti nebo klíčové slovo názvu.
  • Žádné shody? Tento výsledek je normální pro nové služby. Váš plán stále funguje pro budoucí incidenty.
  • Správné číslo? Filtr je dobře vyladěný.

Vyberte Vytvořit pro uložení plánu.

Kontrolní bod: Plán se zobrazí v mřížce se stavem Zapnuto (zelený odznáček).

Krok 4: Vypnutí a zapnutí plánu

Vyberte plán tak, že v mřížce zaškrtnete jeho políčko.

  1. Na panelu nástrojů vyberte Vypnout . Zobrazí se dialogové okno s potvrzením.

  2. Pokud chcete plán zakázat, vyberte Ano .

Stavový odznáček se změní na Vypnuto. Skener zastaví porovnávání incidentů s tímto plánem. Konfigurace filtru se zachová.

Chcete-li plán znovu povolit:

  1. Znovu vyberte plán.

  2. Vyberte Zapnout. Projeví se okamžitě a nevyžaduje další potvrzení.

Stavový odznáček se vrátí na Zapnuto.

Kontrolní bod: Přepínač funguje. Plán můžete přepínat mezi zapnutým a vypnutým, aniž byste ho odstranili.

Krok 5: Ověření v mřížce plánů odpovědí

Svůj plán můžete zobrazit přímo v mřížce plánů reakcí na incidenty s ikonou stavu, upraveným agentem, filtrem závažnosti a sloupci pro úroveň autonomie.

Kontrolní bod: Váš plán se zobrazí v mřížce se správným stavem, vlastním agentem a závažností.

Návod

Pomocí filtru Název můžete bezpečně testovat. Nastavte ho tak, "[TEST] CPU spike"aby odpovídal konkrétnímu názvu testovacího incidentu (například) a vytvořil testovací incident s tímto názvem. Tato metoda ověří chování vašeho agenta, aniž by to ovlivnilo produkční směrování. Po ověření upravte nebo odeberte filtr názvu.

Úprava nebo odstranění plánu reakce

Edit

  1. V mřížce plánů odpovědí vyberte odkaz na ID plánu pro otevření plánu.
  2. Otevře se zobrazení pro úpravy s předem vyplněným veškerým aktuálním nastavením.
  3. Upravte kritéria filtru, vlastního agenta nebo úroveň autonomie.
  4. Výběrem možnosti Uložit se vaše změny uplatní.

Delete

  1. Pomocí zaškrtávacího políčka v mřížce vyberte plán.
  2. Na panelu nástrojů vyberte Odstranit .
  3. Zobrazí se dialogové okno s potvrzením. Potvrďte výběrem možnosti Ano.

Odstraněné plány okamžitě zastaví směrování incidentů. Aktivní šetření zahájená plánem pokračují až do dokončení.

Co jste se naučili

  • Jak vytvořit plány reakcí ze stránky Plány reakcí na incidenty
  • Jak kritéria filtru (závažnost, služba, typ, název) směrují incidenty ke správnému přiřazenému agentovi.
  • Jak si prohlédnout odpovídající historické incidenty před potvrzením
  • Jak použít přepínač pro povolení/zakázání, aby bylo možné pozastavit nebo obnovit směrování.
  • Jak ověřit plány v zobrazení sjednocené mřížky na plátně agenta
  • Rozdíl mezi úrovněmi autonomie pro autonomní a revizní.
zdroj Co se naučíte
Plány reakce na incidenty Vysvětlení možností úplných plánů odezvy
Připojte telemetrický zdroj Udělení přístupu k datům protokolů vlastnímu agentovi
Hloubkové šetření Analýza komplexní původní příčiny
Uživatelské agenti Specializovaní agenti na míru pro různé typy incidentů