Paso 4: Configuración de la respuesta a incidentes en el agente de SRE de Azure

Tiempo estimado: 10 minutos

Conecte la plataforma de incidentes y cree un plan de respuesta. Cuando llegan incidentes, el agente investiga y genera automáticamente planes de ejecución detallados.

Lo que logras

Al final de este paso, el agente:

  • Recibe incidentes de Azure Monitor, PagerDuty o ServiceNow.
  • Investiga automáticamente los incidentes coincidentes
  • Genera planes de ejecución de IA a partir de las instrucciones.
  • Recopila pruebas y proporciona recomendaciones

Prerrequisitos

Requisito Detalles
Agente creado Complete El Paso 1: Cree su agente primero.
Plataforma de incidentes Azure Monitor (valor predeterminado), PagerDuty o ServiceNow.

Sugerencia

Aunque no es necesario, completar el paso 2: Agregar conocimiento y Paso 3: Conectar código fuente mejora significativamente la respuesta a incidentes. El agente hace referencia a sus runbooks y correlaciona los problemas con cambios de código específicos, lo que hace pasar las investigaciones genéricas en análisis de los problemas raíz específicos del equipo.

Conexión de la plataforma de incidentes

Elija y configure la plataforma de incidentes que usa el equipo.

Azure Monitor (valor predeterminado)

Azure Monitor se conecta automáticamente al crear el agente. No se necesita ninguna configuración adicional.

PagerDuty o ServiceNow

Para conectar PagerDuty o ServiceNow como plataforma de incidentes:

  1. Seleccione Configuración en la barra lateral izquierda.
  2. Seleccione Plataforma de incidentes.
  3. Elija la plataforma en la lista desplegable:
    • PagerDuty: escriba la clave de acceso de la API REST.
    • ServiceNow: escriba la dirección URL y las credenciales de la instancia.
  4. Haga clic en Guardar.

El agente ahora recibe incidentes de tu plataforma.

Creación de un plan de respuesta

Cree planes de respuesta en el lienzo del Generador de subagentes. Puede ver qué desencadenadores direccionan a qué sub-agentes.

  1. Seleccione Generador en la barra lateral izquierda.
  2. Seleccione Subagent builder (Generador de subagentes).
  3. Busque el subagente que desea controlar incidentes y seleccione el + botón en su lado izquierdo.
  4. Seleccione Agregar desencadenador de incidentes.
  5. Configure el desencadenador: establezca un nombre, seleccione los niveles de gravedad (por ejemplo, P1 y P2), elija el servicio afectado y, opcionalmente, agregue un filtro de palabra clave title.
  6. Elija el nivel de autonomía (se recomienda que se inicie la revisión ).
  7. Obtenga una vista previa de los incidentes coincidentes y, a continuación, seleccione Crear.

El desencadenador aparece como un nodo conectado al subagente en el lienzo.

Importante

Cuando se conecta por primera vez una plataforma de incidentes, se crea automáticamente un plan de respuesta de inicio rápido predeterminado. Si crea sus propios planes de respuesta, el plan de inicio rápido se ejecuta junto con ellos y puede hacer que los incidentes se enruten al agente personalizado incorrecto o se procesen dos veces. Para evitar conflictos, vaya a Builder>Planes de respuesta a incidentes, cambie a Vista de tabla y elimine el plan de inicio rápido.

Para obtener la guía paso a paso completa con capturas de pantalla, consulte el tutorial Configuración de un desencadenador de incidentes.

Planes de respuesta que se muestran en el lienzo del generador de subagentes.

¿Qué ocurre cuando llega un incidente?

Cuando un incidente coincide con el plan, el agente lo controla automáticamente.

  1. Recupera los detalles del incidente de tu plataforma.
  2. Busca memoria para incidentes anteriores similares y documentación relevante.
  3. Ejecuta el plan mediante la ejecución de comandos y la recopilación de evidencia.
  4. Resume los resultados con marcas de tiempo y recomendaciones.

Búsqueda de memoria en la que se muestran incidentes pasados y documentación relevante.

Resultados de ejemplo

En el ejemplo siguiente se muestran los hallazgos de un incidente de una aplicación de contenedores.

Resumen:

  • El contenedor se reinició aproximadamente a las 01:27Z con una caída abrupta de memoria.
  • Configuración actual: 2 Gi memory, 1 CPU, minReplicas=2, maxReplicas=4.

Causa probable: Reinicio transitorio del contenedor (OOM o implementación).

Acciones recomendadas:

  1. Aumente minReplicas a 3-4 para reducir el impacto del reinicio.
  2. Revise los sondeos de estado del contenedor.

El agente proporciona recomendaciones procesables basadas en evidencias, no consejos genéricos.

Paso siguiente