Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Durante los incidentes, a menudo encuentras el contexto disperso entre alertas, paneles, tickets y repositorios. Azure SRE Agent se conecta a tus recursos de Azure, herramientas de observabilidad, plataformas de incidentes y repositorios de código fuente para que puedas investigar problemas con más contexto operativo en un solo lugar. Utilízalo para recopilar señales, comparar problemas actuales con investigaciones previas y ejecutar automatización gobernada dentro de permisos, modos de ejecución y políticas configurados.
Qué puede hacer
Azure SRE Agent ayuda a tu equipo a investigar incidentes y responder con más rapidez. Recopila contexto, identifica causas probables y sugiere o, cuando está configurado, ejecuta mitigaciones.
Por ejemplo, durante un incidente relacionado con la memoria, el Agente SRE puede:
- Detectar tendencias de memoria: Consultar Application Insights para identificar una tendencia de memoria que comenzó 40 minutos antes de la alerta
- Correlaciona los despliegues: Vincula la tendencia a un evento de despliegue de repositorio de GitHub dos horas antes
- Proponga mitigaciones: Identifique el commit específico y proponga que se reinicie el pod afectado o ajustar el umbral de escalado de memoria (escalador automático horizontal de pods, o HPA)
- Precompletar tickets de incidentes: Crea un ticket en ServiceNow, PagerDuty o en un canal de incidentes con el resumen completo de la investigación precompletado
Estos flujos de trabajo configurados notifican a las personas adecuadas mientras el Agente SRE trabaja en una propuesta de mitigación. En modo Revisión, un administrador de un Agente SRE revisa el resumen con el contexto adjunto del libro de operaciones y aprueba las acciones que requieren aprobación. La investigación se mantiene en un solo hilo, lo que reduce la necesidad de cambiar de herramienta. Si el agente aplica una mitigación automáticamente o espera la aprobación depende del modo de ejecución configurado.
Este patrón se aplica a servicios e integraciones de Azure configurados, incluyendo computación, almacenamiento, redes, datos y servicios relacionados de monitorización y gestión. Amplíalo con operaciones permitidas de CLI de Azure mediante habilidades, runbooks aprobados o agentes personalizados. Utiliza ganchos de agente para añadir puntos de control de gobernanza que puedan permitir o bloquear acciones.
El trabajo del agente sigue tres patrones:
Automatizar incidentes: En estado de alerta, el agente consulta tus herramientas de monitorización, correlaciona señales entre sistemas, identifica la causa raíz probable y propone mitigaciones.
Automatiza flujos de trabajo programados: Programa controles proactivos de salud, controles de cumplimiento y tareas operativas rutinarias. Los resultados se muestran en la plataforma de incidentes conectada o en el canal de notificación.
Investiga y aconseja: Haz preguntas en lenguaje natural sobre tu entorno, como "¿qué ha cambiado en la última hora?" o "¿por qué se degrada este servicio?", y obtén respuestas fundamentadas y citadas por fuentes.
Cómo funciona
SRE Agent combina conocimientos específicos de producto de Azure con la personalización que tú controlas. Por defecto, puede consultar y actuar sobre recursos de Azure dentro de los permisos asignados, con comportamiento incorporado para tareas operativas comunes.
El agente opera a través de cinco puntos de extensión que puedes personalizar:
Aptitudes: funcionalidades discretas, incluidos runbooks de Marketplace y scripts de CLI de Azure, que amplían el alcance operativo del agente sin necesidad de código personalizado.
Agentes personalizados: Agentes diseñados específicamente para dominios operativos específicos. Varios agentes especializados ya vienen listos para usar, y puedes crear el tuyo propio en el creador de agentes. Consulte Agentes personalizados.
Python herramientas: lógica personalizada, transformaciones de datos e integraciones de API para escenarios que requieren código en lugar de configuración.
Servidores MCP: Conectarse a conectores asociados preconfigurados para plataformas de observabilidad como Datadog, Splunk, New Relic, Dynatrace y Elasticsearch, o conectar cualquier herramienta personalizada a través del estándar Model Context Protocol. Consulta conectores y herramientas MCP.
Ganchos de agentes: automatizaciones activadas por eventos que se ejecutan en puntos definidos del ciclo de vida del agente, como después de que una herramienta se ejecute o cuando el agente se detiene. Use enlaces para aplicar directivas, emitir telemetría o integrarse con flujos de trabajo de aprobación externos. Ver ganchos de agente.
Cada llamada a la herramienta propuesta pasa por controles de gobernanza antes de ejecutarse, así que tu equipo define los límites incluso para flujos de trabajo totalmente automatizados. Para obtener más información, consulte Seguridad y gobernanza.
Integrations
Azure SRE Agent se conecta a las herramientas que tu equipo ya utiliza:
Supervisión y observabilidad:
- Azure Monitor (métricas, registros, alertas, cuadernos)
- Application Insights
- Log Analytics
Administración de incidentes:
- Alertas de Azure Monitor
- PagerDuty
- ServiceNow
Control de código fuente y CI/CD:
- GitHub (repositorios, problemas)
- Azure DevOps (repositorios, elementos de trabajo)
Orígenes de datos:
- Clústeres de Azure Data Explorer (Kusto)
- Servidores de Protocolo de contexto de modelo (MCP)
Comunicación y notificaciones:
- Equipos de Microsoft
- Outlook
Dependiendo de tu configuración, Azure SRE Agent también ofrece conectores gestionados, un sistema de conectores separado que puede vincular tu agente a servicios SaaS como Google Drive, SharePoint, Notion y Confluence.
Seguridad y gobernanza
Los equipos de seguridad y plataformas pueden aplicar controles en capas a través de la red, identidad, autorización y gobernanza organizativa:
Aislamiento de red: La integración de VNet enruta el tráfico del espacio de trabajo de agentes a través de tu red virtual. Tus reglas de grupo de seguridad de red (NSG) se aplican mientras tu DNS privado resuelve las solicitudes. Cuando configuras correctamente el enrutamiento de red, DNS y permisos, puedes acceder a endpoints privados, APIs internas y recursos bloqueados como cualquier otro recurso en tu red virtual (VNet).
Identidad y RBAC: El agente autentica con identidad gestionada y opera bajo control de acceso basado en roles (RBAC) de Azure. Para el código fuente, el soporte de GitHub Enterprise permite que el agente se autentique como una identidad de servicio gobernado mediante un modelo Bring Your Own GitHub App.
Control de acceso a nivel de herramienta: Configura cada herramienta que utiliza el agente para permitir, preguntar o denegar. Los administradores establecen barreras globales, los líderes de equipo personalizan cada agente personalizado y los usuarios aprueban las herramientas dentro de su conversación. Las opciones disponibles, los valores predeterminados y la precedencia dependen del alcance y la política vigente. Para más detalles, véase políticas de acceso a herramientas.
Infraestructura como código: Despliega el agente, su configuración de red, su identidad y sus políticas de herramientas mediante plantillas de Bicep (el lenguaje de infraestructura como código de Azure) y CLI de Azure a través de las mismas pipelines CI/CD que usas para cualquier otro recurso de Azure.
Distribución gobernada de habilidades: Los equipos de la plataforma pueden publicar habilidades aprobadas en un repositorio privado de GitHub utilizando el Private Plugins Marketplace. Los agentes de todo el tenant instalan habilidades aprobadas desde el mismo catálogo controlado.
Reutilizar el contexto operativo
Azure SRE Agent conserva el contexto de investigaciones previas y utiliza la generación de información de fondo y la información de sesión para reconocer patrones recurrentes o contextos relacionados. El contexto retenido puede incluir causas raíz, pasos de resolución, preferencias y patrones operativos. Reutilizarlo puede limitar la recopilación repetida de contexto, reducir la dependencia del conocimiento individual no documentado y proporcionar a los ingenieros de guardia información inicial más consistente.
Tip
Ejemplo de equipo: Un nuevo ingeniero se incorpora a la guardia. El agente ya conoce los patrones de despliegue, incidentes pasados y procedimientos del equipo, así que empieza con más contexto desde el primer día.
Ejemplo único: Vas de vacaciones. El contexto operativo que ha recopilado el agente está disponible para quien tome el relevo, para que no tenga que empezar de cero.
| Stage | ¿Qué ocurre? |
|---|---|
| Configuración inicial | Conecta tus herramientas y utiliza el conocimiento integrado de Azure durante una investigación. |
| Tras repetidas investigaciones | El contexto retenido puede incluir la topología del entorno, patrones de fallo recurrentes y preferencias de escalada. |
| A medida que se acumula el contexto compartido | Los miembros del equipo pueden reutilizar causas raíz previas y pasos de resolución con menos dependencia del conocimiento individual no documentado. |
Comienza
Elige el camino que se ajuste a tu objetivo: programar una tarea, gestionar un incidente o crear un agente personalizado.
Use tareas programadas para automatizar el trabajo operativo rutinario (comprobaciones de estado, limpieza y barridos de cumplimiento) sin escribir código de infraestructura.
Seleccione la pestaña Programar tareas .
Escriba los detalles de la tarea.
Defina la programación para ejecutar la tarea.
Cree instrucciones de agentes personalizados para la tarea.
Seleccione Crear tarea programada.
Ves los resultados de tu tarea programada en la plataforma de incidentes o canal de notificaciones conectado.
Contenido relacionado
Utiliza estos recursos para planificar el despliegue, la gobernanza, la facturación y la incorporación del equipo:
| Recurso | Lo que encuentras |
|---|---|
| Precios y facturación | Precios basados en el uso medidos en Azure Agent Units (AAUs), además de planificación de capacidad |
| Información general sobre seguridad | Manejo de datos, privacidad y aislamiento de ejecución |
| Creación y configuración | Despliega un agente y concédele acceso a recursos seleccionados de Azure. |
| Configuración y roles del equipo y roles y permisos de usuario | Cómo los roles controlan quién puede charlar, aprobar y administrar al agente, además de cómo enseñarle sobre tu equipo, servicios y procedimientos |