Étape 4 : Configurer la réponse aux incidents dans Azure SRE Agent

Durée estimée : 10 minutes

Connectez votre plateforme d’incidents et créez un plan de réponse. Lorsque des incidents arrivent, votre agent examine et génère automatiquement des plans d’exécution détaillés.

Ce que vous avez accompli

À la fin de cette étape, votre agent :

  • Reçoit des incidents d’Azure Monitor, PagerDuty ou ServiceNow
  • Examine automatiquement les incidents correspondants
  • Génère des plans d’exécution d’IA à partir de vos instructions
  • Collecte des preuves et fournit des recommandations

Prerequisites

Prérequis Détails
Agent créé Étape 1 complète : commencez par créer votre agent.
Plateforme d’incidents Azure Monitor (par défaut), PagerDuty ou ServiceNow.

Conseil / Astuce

Bien qu’il ne soit pas nécessaire, l’étape 2 : Ajouter des connaissances et l’étape 3 : connecter le code source améliore considérablement la réponse aux incidents. Votre agent fait référence à vos runbooks et met en corrélation des problèmes à des modifications de code spécifiques, ce qui transforme les enquêtes génériques en analyse de la cause racine spécifique à l’équipe.

Connecter votre plateforme d’incidents

Choisissez et configurez la plateforme d’incident utilisée par votre équipe.

Azure Monitor (par défaut)

Azure Monitor se connecte automatiquement lorsque vous créez votre agent. Aucune configuration supplémentaire n’est nécessaire.

PagerDuty ou ServiceNow

Pour connecter PagerDuty ou ServiceNow en tant que plateforme d’incidents :

  1. Sélectionnez Paramètres dans la barre latérale gauche.
  2. Sélectionnez Incident platform.
  3. Choisissez votre plateforme dans la liste déroulante :
    • PagerDuty : entrez votre clé d’accès à l’API REST.
    • ServiceNow : entrez l’URL et les informations d’identification de votre instance.
  4. Cliquez sur Enregistrer.

Votre agent reçoit désormais des incidents de votre plateforme.

Créer un plan de réponse

Créez des plans de réponse à partir de l'interface Subagent builder. Vous pouvez voir quels déclencheurs routent vers quels sous-éléments.

  1. Sélectionnez Générateur dans la barre latérale gauche.
  2. Sélectionnez Constructeur de sous-agent.
  3. Recherchez le sous-agent que vous souhaitez gérer les incidents et sélectionnez le + bouton sur son côté gauche.
  4. Sélectionnez Ajouter un déclencheur d’incident.
  5. Configurez le déclencheur : définissez un nom, sélectionnez des niveaux de gravité (par exemple, P1 et P2), choisissez le service concerné et ajoutez éventuellement un filtre de mot clé de titre.
  6. Choisissez le niveau d’autonomie (Review est recommandé pour commencer).
  7. Afficher un aperçu des incidents correspondants, puis sélectionner Créer.

Votre déclencheur apparaît en tant que nœud connecté au sous-composant sur le canevas.

Important

Lorsque vous connectez pour la première fois une plateforme d’incidents, un plan de réponse de démarrage rapide par défaut est créé automatiquement. Si vous créez vos propres plans de réponse, le plan de démarrage rapide s’exécute en parallèle et peut entraîner l’acheminement des incidents vers le mauvais agent personnalisé ou leur traitement en double. Pour éviter les conflits, accédez auxplans de réponse aux incidents du >, basculez vers la vue Table et supprimez le plan de démarrage rapide.

Pour obtenir le guide pas à pas complet avec des captures d’écran, consultez le didacticiel Configurer un déclencheur d’incident.

Plans de réponse affichés sur le canevas du générateur de sous-agents.

Que se passe-t-il lorsqu’un incident arrive

Lorsqu’un incident correspond à votre plan, l’agent le gère automatiquement.

  1. Récupère les détails de l’incident à partir de votre plateforme.
  2. Recherche dans la mémoire des incidents passés similaires et de la documentation pertinente.
  3. Exécute le plan en exécutant des commandes et en collectant des preuves.
  4. Résume les résultats avec des horodatages et des recommandations.

Recherche de mémoire montrant les incidents passés et la documentation pertinente.

Exemples de résultats

L’exemple suivant montre les résultats d’un incident d’application conteneur :

Résumé :

  • Le conteneur a redémarré vers 01:27Z suite à une chute brutale de la mémoire.
  • Configuration actuelle : 2 Gio de mémoire, 1 PROCESSEUR, minReplicas=2, maxReplicas=4.

Cause probable : Redémarrage temporaire du conteneur (OOM ou déploiement).

Actions recommandées :

  1. Augmentez minReplicas à 3 à 4 pour réduire l’impact du redémarrage.
  2. Passez en revue les sondes d’intégrité des conteneurs.

Votre agent fournit des recommandations actionnables basées sur des preuves, et non sur des conseils génériques.

Étape suivante