Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Lors des incidents, vous trouvez souvent du contexte dispersé entre alertes, tableaux de bord, tickets et dépôts. Azure SRE Agent se connecte à vos ressources Azure, outils d’observabilité, plateformes d’incidents et dépôts de code source afin que vous puissiez enquêter sur les problèmes avec un contexte opérationnel plus large en un seul endroit. Utilisez-le pour recueillir des signaux, comparer les problèmes actuels avec les enquêtes précédentes, et exécuter une automatisation gouvernée au sein des permissions, modes d’exécution et politiques configurés.
Ce que vous pouvez faire
Azure SRE Agent aide votre équipe à enquêter sur les incidents et à répondre plus rapidement. Il recueille le contexte, identifie les causes probables et suggère ou, une fois configuré, met en œuvre des mesures d’atténuation.
Par exemple, lors d’un incident lié à la mémoire, SRE Agent peut :
- Détecter les tendances mémoire : Interroger Application Insights pour identifier une tendance mémoire qui a commencé 40 minutes avant l’alerte
- Corrélez les déploiements : Associez la tendance à un événement de déploiement d’un dépôt GitHub deux heures plus tôt
- Proposez des mesures d’atténuation : Identifiez le commit spécifique et proposez de redémarrer le pod affecté ou d’ajuster le seuil d’échelle mémoire (autoscaler horizontal pod, ou HPA)
- Préremplir les tickets d’incident : Créez un ticket ServiceNow, PagerDuty ou un ticket de canal d’incident avec le résumé complet de l’enquête prérempli
Ces flux de travail configurés notifient les personnes appropriées pendant que l’Agent SRE travaille sur une atténuation proposée. En mode Révision, un administrateur Agent SRE examine le résumé avec le contexte du runbook joint et approuve les actions nécessitant une approbation. L’investigation reste dans le même fil, limitant les changements d’outil. Que l’agent applique automatiquement une atténuation ou qu’il attende l’approbation dépend de votre mode d’exécution configuré.
Ce schéma s’applique aux services et intégrations Azure configurés, y compris le calcul, le stockage, le réseau, les données et les services de surveillance et de gestion associés. Étendez-la avec des opérations Azure CLI autorisées au moyen de compétences, de runbooks approuvés ou d’agents personnalisés. Utilisez des hooks d’agent pour ajouter des points de contrôle pour la gouvernance afin d’autoriser ou de bloquer des actions.
Le travail de l’agent suit trois schémas :
Automatisez les incidents : En alerte, l’agent interroge vos outils de surveillance, corrélage les signaux entre les systèmes, identifie la cause probable et propose des mesures d’atténuation.
Automatisez les flux de travail planifiés : planifiez des contrôles proactifs de santé, des balayages de conformité et des tâches opérationnelles de routine. Les résultats s’affichent dans votre plateforme d’incidents connectée ou votre canal de notification.
Enquêtez et conseillez : posez des questions en langage naturel sur votre environnement, comme « qu’est-ce qui a changé dans la dernière heure ? » ou « pourquoi ce service est-il dégradé ? », et obtenez des réponses ancrées et citées par des sources.
Fonctionnement
SRE Agent combine une connaissance spécifique des produits Azure avec une personnalisation que vous contrôlez. Par défaut, il peut interroger et agir sur les ressources Azure avec les autorisations attribuées, avec un comportement intégré pour les tâches opérationnelles courantes.
L’agent fonctionne via cinq points d’extension que vous pouvez personnaliser :
Compétences : fonctionnalités discrètes, notamment les runbooks de la Place de marché et les scripts Azure CLI, qui étendent la portée opérationnelle de l'agent sans nécessiter de code personnalisé.
Agents personnalisés : Agents conçus spécialement pour des domaines opérationnels spécifiques. Plusieurs agents spécialisés sont fournis prêts à l’emploi, et vous pouvez créer les vôtres dans le générateur d’agents. Consultez agents personnalisés.
Python outils : logique personnalisée, transformations de données et intégrations d’API pour les scénarios nécessitant du code plutôt que la configuration.
Serveurs MCP : Connectez-vous à des connecteurs partenaires préconfigurés pour des plateformes d’observabilité telles que Datadog, Splunk, New Relic, Dynatrace et Elasticsearch, ou connectez tout outil personnalisé via la norme Model Context Protocol. Voir connecteurs et outils MCP.
Accroches d’agent : Automatisations déclenchées par des événements qui s’exécutent à des points définis du cycle de vie de l’agent, comme après l’exécution d’un outil ou lors de l’arrêt de l’agent. Utilisez des hooks pour appliquer des stratégies, émettre des données de télémétrie ou intégrer des flux de travail d’approbation externes. Consultez Agent hooks.
Chaque appel d’outil proposé passe par des contrôles de gouvernance avant même de s’exécuter, donc votre équipe définit les limites même pour des flux de travail entièrement automatisés. Pour plus d’informations, voir Sécurité et gouvernance.
Integrations
Azure SRE Agent se connecte aux outils que votre équipe utilise déjà :
Surveillance et observabilité :
- Azure Monitor (métriques, journaux, alertes, classeurs)
- Application Insights
- Log Analytics
Gestion des incidents :
- Alertes Azure Monitor
- PagerDuty
- ServiceNow
Contrôle de code source et CI/CD :
- GitHub (référentiels, problèmes)
- Azure DevOps (dépôts, éléments de travail)
Sources de données :
- Clusters de Azure Data Explorer (Kusto)
- Serveurs MCP (Model Context Protocol)
Communication et notifications :
- Microsoft Teams
- Outlook
Selon votre configuration, Azure SRE Agent propose également des connecteurs gérés, un système de connecteurs distinct qui peut relier votre agent à des services SaaS tels que Google Drive, SharePoint, Notion et Confluence.
sécurité et gouvernance
Les équipes de sécurité et de plateforme peuvent appliquer des contrôles en couches sur le réseau, l’identité, l’autorisation et la gouvernance organisationnelle :
Isolation réseau : l’intégration VNet achemine le trafic de l’espace de travail de l’agent via votre réseau virtuel. Les règles de votre groupe de sécurité réseau (NSG) s’appliquent pendant que votre DNS privé résout les requêtes. Lorsque vous configurez correctement le routage réseau, le DNS et les permissions, vous pouvez accéder aux points d’accès privés, aux API internes et aux ressources verrouillées comme n’importe quelle autre ressource de votre réseau virtuel (VNet).
Identité et RBAC : L’agent s’authentifie avec une identité gérée et opère sous le contrôle d’accès basé sur le rôle (RBAC) d’Azure. Pour le code source, le support GitHub Enterprise permet à l’agent de s’authentifier en tant qu’identité de service gouverné via un modèle Bring Your Own GitHub App.
Contrôle d’accès au niveau de l’outil : Configurez chaque outil utilisé par l’agent pour autoriser, demander ou refuser. Les administrateurs fixent des limites globales, les chefs d’équipe personnalisent chaque agent personnalisé, et les utilisateurs approuvent les outils dans leur conversation. Les options disponibles, les paramètres par défaut et la priorité dépendent de la portée et de la politique en vigueur. Pour plus de détails, voir les politiques d’accès aux outils.
Infrastructure en tant que code : déployez l'agent, sa configuration réseau, son identité et ses politiques d'outils via les modèles Bicep (le langage infrastructure-as-code d'Azure) et Azure CLI via les mêmes pipelines CI/CD que vous utilisez pour toutes les autres ressources Azure.
Répartition réglementée des compétences : Les équipes de la plateforme peuvent publier les compétences approuvées dans un dépôt privé GitHub en utilisant le Private Plugins Marketplace. Les agents du locataire installent des compétences approuvées dans le même catalogue réglementé.
Réutilisation du contexte opérationnel
Azure SRE Agent conserve le contexte des enquêtes antérieures et utilise la génération d’insights en arrière-plan et les insights de session pour reconnaître des schémas récurrents ou des contextes liés. Le contexte conservé peut inclure les causes profondes, les étapes de résolution, les préférences et les schémas opérationnels. La réutiliser peut limiter la collecte répétée de contextes, diminuer la dépendance aux connaissances individuelles non documentées et fournir aux ingénieurs de garde des informations de départ plus cohérentes.
Tip
Exemple d'équipe : Un nouvel ingénieur intègre l'astreinte. L’agent connaît déjà les schémas de déploiement, les incidents passés et les procédures de l’équipe, donc il commence par donner plus de contexte dès le premier jour.
Exemple solo : Tu vas en vacances. Le contexte opérationnel capturé par l’agent est accessible à la personne qui prend le relais, afin qu’elle ne reparte pas de zéro.
| Étape | Que se passe-t-il ? |
|---|---|
| Configuration initiale | Connectez vos outils et utilisez les connaissances Azure intégrées lors d’une enquête. |
| Après de nombreuses enquêtes | Le contexte conservé peut inclure la topologie de l’environnement, les schémas de défaillance récurrents et les préférences d’escalade. |
| À mesure que le contexte partagé s’accumule | Les membres de l’équipe peuvent réutiliser les causes profondes antérieures et les étapes de résolution avec moins de dépendance aux connaissances individuelles non documentées. |
Get started
Choisissez la voie qui correspond à votre objectif : planifier une tâche, gérer un incident ou créer un agent personnalisé.
Utilisez des tâches planifiées pour automatiser le travail opérationnel de routine (contrôles d’intégrité, nettoyage et balayages de conformité) sans écrire de code d’infrastructure.
Sélectionnez l’onglet Planifier les tâches .
Entrez les détails de la tâche.
Définissez la planification pour exécuter votre tâche.
Créer des instructions personnalisées pour l'agent chargé de la tâche.
Sélectionnez Créer une tâche planifiée.
Vous voyez les résultats de votre tâche programmée sur votre plateforme d’incident connectée ou votre canal de notification.
Contenu connexe
Utilisez ces ressources pour planifier le déploiement, la gouvernance, la facturation et l’intégration de l’équipe :
| Ressource | Ce que vous trouvez |
|---|---|
| Tarification et facturation | Tarification basée sur l’utilisation mesurée dans Azure Agent Units (AAU), plus planification de capacité |
| Vue d’ensemble de la sécurité | Gestion des données, confidentialité et isolation de l’exécution |
| Créer et configurer | Déploie un agent et accorde-lui l’accès à certaines ressources Azure. |
| Configuration et rôles d’équipe et rôles d’utilisateur et permissions | Comment les rôles contrôlent qui peut discuter, approuver et gérer l’agent, ainsi que comment lui enseigner l’identité de votre équipe, de vos services et de vos procédures |