Tworzenie planu reagowania na zdarzenia w agencie usługi Azure SRE

Plany reagowania kierują przychodzące incydenty do odpowiedniego niestandardowego agenta na podstawie zdefiniowanych przez Ciebie kryteriów filtrowania. W tym samouczku utworzysz plan reagowania w kanwie agenta, sprawdzisz podgląd incydentów, do których pasuje, i użyjesz przełącznika włączania/wyłączania, aby określić, kiedy ma być aktywny.

Wymagania wstępne

  • Agent z połączoną platformą incydentów (PagerDuty, ServiceNow lub Azure Monitor)
  • Co najmniej jeden skonfigurowany agent niestandardowy
  • Rola współautora lub właściciela zasobu agenta

Krok 1: Otwórz obszar roboczy agenta

W portalu agenta SRE wybierz agenta. Na lewym pasku bocznym przejdź do KonstruktorKanwa Agenta.

Ważna

Przy pierwszym połączeniu platformy incydentów zostanie automatycznie utworzony domyślny plan reagowania quickstart. Jeśli tworzysz własne plany reagowania, plan szybkiego wdrożenia działa równolegle z nimi i może spowodować kierowanie incydentów do niewłaściwego agenta niestandardowego lub ich dwukrotne przetwarzanie. Aby uniknąć konfliktów, przejdź do Konstruktor>Plany reagowania na zdarzenia, przełącz na widok tabeli i usuń plan szybkiego uruchamiania.

Krok 2. Tworzenie nowego planu odpowiedzi

Na kanwie agenta wybierz pozycję Utwórz na pasku narzędzi. Wybierz Wyzwól>plan reagowania na incydenty.

Zostanie otwarte okno dialogowe tworzenia.

Wypełnij kryteria filtrowania. Wyświetlane pola zależą od platformy zdarzeń:

  • Nazwa planu reagowania na zdarzenia: wprowadź opisową nazwę, na przykład high-sev-api-trigger.

W przypadku usługi Azure Monitor:

  • Ważność: wybierz co najmniej jeden poziom ważności.

  • Tytuł zawiera (opcjonalnie): dodaj słowo kluczowe, aby dalej zawęzić dopasowania.

Dla PagerDuty / ServiceNow:

  • Usługa, której dotyczy ten plan, wybierz tę usługę lub wybierz pozycję Wszystkie.

  • Typ zdarzenia: wybierz klasyfikację zdarzeń lub wybierz pozycję Wszystkie typy zdarzeń.

  • Priorytet: wybierz co najmniej jeden poziom priorytetu, taki jak P1 i P2.

  • Tytuł zawiera (opcjonalnie): dodaj słowo kluczowe, aby dalej zawęzić dopasowania.

Wybierz konfigurację odpowiedzi:

  • Niestandardowy agent odpowiedzi: wybierz niestandardowego agenta odpowiedzi, który obsługuje dopasowane incydenty.

  • Poziom autonomii agenta: wybierz sposób reagowania agenta:

    • Autonomiczne (ustawienie domyślne): Agent niezależnie bada i wykonuje środki zaradcze.
    • Przegląd: Twój agent proponuje działania do zatwierdzenia przed wykonaniem.

Uwaga / Notatka

Po wybraniu opcji Autonomiczne (wartość domyślna), obok tej opcji pojawi się ikona ℹ. Wybierz tę opcję, aby zapoznać się z potwierdzeniem dotyczącym trybu autonomicznego, które wyjaśnia, co oznacza autonomiczne wykonywanie, w tym zakres działania agentów, ograniczenia modeli AI oraz Twoje obowiązki. Aby uzyskać szczegółowe informacje, zobacz Potwierdzenie trybu autonomicznego .

Wskazówka

Zacznij od trybu przeglądu dla nowych planów, jeśli chcesz zweryfikować zachowanie badania agenta przed przyznaniem pełnej autonomii. Nowe plany domyślnie są ustawione na Autonomiczne.

Konfiguracja okresu odnowienia ponownego zbadania alertów (tylko Azure Monitor)

Jeśli platforma zdarzeń to Azure Monitor, sekcja Reinvestigation cooldown pojawi się poniżej poziomu autonomii.

  • Włącz (pole wyboru, wartość domyślna: włączone): Gdy jest włączone, cykliczne wywoływanie tej samej reguły alertu w oknie odnowienia scala się z istniejącym wątkiem śledztwa zamiast rozpoczynać nowy. Rozwiązane wątki w oknie są ponownie otwierane.

  • Czas chłodzenia (wybierak, wartość domyślna: 3 godziny, zakres: 1-24): Okres, jaki musi upłynąć po rozwiązaniu lub zamknięciu wątku, zanim nowe zdarzenie zainicjuje nowe dochodzenie, zamiast ponownie otwierać aktualny wątek.

Pozostaw wartości domyślne dla większości reguł alertów. Wyłącz ochładzania tylko w przypadku alertów krytycznych, w których każde pożary wymagają niezależnego badania.

Ostrzeżenie

Wyłączenie ochładzania może znacznie zwiększyć użycie tokenów dla hałaśliwych reguł alertów. Reguła uruchamiana co 5 minut tworzy nowe badanie za każdym razem.

Wypełnij wszystkie wymagane pola: nazwa planu, usługa, typ zdarzenia, a co najmniej jeden poziom priorytetu. Przycisk Dalej zostanie włączony.

Krok 3. Podgląd pasujących zdarzeń

Wybierz Dalej. Podgląd zdarzeń przedstawia tabelę przeszłych zdarzeń spełniających kryteria filtrowania.

Zostanie wyświetlona tabela:

  • Priorytet, data utworzenia, tytuł, identyfikator zdarzenia i stan dla każdego zgodnego zdarzenia
  • Filtr zakresu czasu. Domyślne to Ostatnie 90 dni dla większości platform incydentów oraz Ostatnie 30 dni dla Azure Monitor.

Przejrzyj wyniki:

  • Zbyt wiele dopasowań? Wróć i dodaj ograniczenie zakresu lub słowo kluczowe dotyczące tytułu.
  • Brak dopasowań? Ten wynik jest normalny dla nowych usług. Twój plan nadal działa w przypadku przyszłych zdarzeń.
  • Prawidłowa liczba? Filtr jest dobrze dostrojony.

Wybierz Utwórz, aby zapisać plan.

Punkt kontrolny: Plan jest wyświetlany w siatce ze stanem Włączony (zielony wskaźnik).

Krok 4. Wyłączanie i włączanie planu

Wybierz swój plan, zaznaczając jego pole wyboru w gridzie.

  1. Wybierz pozycję Wyłącz na pasku narzędzi. Pojawia się okno dialogowe potwierdzenia.

  2. Wybierz pozycję Tak , aby wyłączyć plan.

Wskaźnik stanu zmienia się na Wyłączone. Skaner zatrzymuje dopasowywanie zdarzeń względem tego planu. Konfiguracja filtru jest zachowywana.

Aby ponownie włączyć plan:

  1. Wybierz ponownie plan.

  2. Wybierz Włącz. Natychmiast zaczyna obowiązywać bez potwierdzenia.

Wskaźnik stanu powraca do pozycji Włączone.

Punkt kontrolny: Przełącznik działa. Plan można przełączać między włączonym i wyłączonym bez jego usuwania.

Krok 5: Zweryfikuj w tabeli planów odpowiedzi

Plan można wyświetlić bezpośrednio w siatce strony Plany reagowania na zdarzenia z znaczkiem stanu, niestandardowym agentem, filtrem ważności i kolumnami poziomu autonomii.

Punkt kontrolny: Twój plan jest widoczny w tabeli z prawidłowym stanem, agentem niestandardowym i stopniem powagi.

Wskazówka

Użyj filtru Tytuł zawiera, aby bezpiecznie testować. Ustaw go tak, "[TEST] CPU spike"aby był zgodny z określonym tytułem zdarzenia testowego (na przykład ) i utwórz zdarzenie testowe o tym tytule. Ta metoda weryfikuje zachowanie agenta bez wpływu na routing produkcyjny. Po zweryfikowaniu dostosuj lub usuń filtr tytułu.

Edytowanie lub usuwanie planu odpowiedzi

Edit

  1. W siatce planów odpowiedzi wybierz link identyfikatora planu, aby otworzyć plan.
  2. Widok edycji zostanie otwarty ze wszystkimi bieżącymi ustawieniami wstępnie wypełnionymi.
  3. Zmodyfikuj kryteria filtrowania, agenta dostosowanego lub poziom autonomii.
  4. Wybierz Zapisz, aby zastosować zmiany.

Delete

  1. Zaznacz plan, używając pola wyboru w tabeli.
  2. Wybierz pozycję Usuń na pasku narzędzi.
  3. Pojawia się okno dialogowe potwierdzenia. Wybierz Tak, aby potwierdzić.

Usunięte plany natychmiast przestają kierować zdarzeniami. Aktywne badania, które plan rozpoczął, są kontynuowane aż do ich zakończenia.

Czego się nauczyłeś

  • Jak utworzyć plany reagowania na podstawie strony Plany reagowania na zdarzenia .
  • Jak kryteria filtrowania (ważność, usługa, typ, tytuł) przekierowują zdarzenia do odpowiedniego agenta zdefiniowanego przez użytkownika.
  • Jak wyświetlić podgląd pasujących zdarzeń historycznych przed zatwierdzeniem.
  • Jak użyć przełącznika aktywacji/dezaktywacji, aby wstrzymać i wznowić routing.
  • Jak zweryfikować plany w ujednoliconym widoku siatki w obszarze roboczym agenta.
  • Różnica między poziomami Autonomii Autonomicznej i Przegląd.
Resource Czego się uczysz
Plany reagowania na zdarzenia Zrozumienie pełnych możliwości planów odpowiedzi
Podłącz źródło telemetrii Przyznaj niestandardowemu agentowi dostęp do danych z dzienników
Szczegółowe badanie Złożona analiza głównej przyczyny
Agenci niestandardowi Wyspecjalizowani agenci dostosowani dla różnych typów incydentów