Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Azure SRE Agent automatise en toute sécurité les tâches opérationnelles et réduit les tâches fastidieuses, afin que votre équipe consacre moins de temps au triage des incidents et aux procédures manuelles, et plus de temps à développer.
Il connecte vos outils d’observabilité, plateformes d’incident et référentiels de code source dans un flux de travail automatisé unique. Lorsque quelque chose s'arrête à 3h00, au lieu de sauter entre Grafana, PagerDuty et Slack, vous obtenez une enquête avec des réponses déjà présentes, y compris ce qui a changé, ce qui est affecté et ce qu'il faut faire ensuite.
L’agent propose des modifications et votre équipe approuve. Aucune modification n’est déployée sans validation humaine.
Chaque enquête que l’agent exécute génère des connaissances institutionnelles qui persistent dans les conversations et s’accumule au fil du temps, que vous soyez une équipe de vingt ou la seule personne qui sait comment fonctionne le système.
Agent SRE en action
Imaginez des alertes se déclenchant à 2 h 47 du matin pour votre service de paiement depuis Azure Monitor, PagerDuty ou toute autre plateforme de supervision connectée.
En quelques minutes, agent SRE :
- Interroge Application Insights et identifie une tendance de mémoire qui a démarré 40 minutes avant l’alerte
- Met en corrélation la tendance avec un événement de déploiement à partir de votre dépôt GitHub deux heures plus tôt
- Identifie le commit spécifique et propose deux mesures d'atténuation : redémarrer le pod affecté et ajuster le seuil de mise à l'échelle de la mémoire (HPA)
- Crée un ticket dans ServiceNow, PagerDuty ou votre canal d’incident avec le résumé d’investigation complet prérempli
Une notification expose l’atténuation proposée. L’ingénieur en appel passe en revue le résumé et approuve avec une seule action, sans runbook requis et sans changement de contexte. L’investigation est résolue en 7 minutes dans un seul fil, sans cellule de crise et sans avoir à passer d’un onglet à l’autre entre Grafana, PagerDuty et Slack.
Fonctionnalités de gestion des services Azure
L’agent SRE peut gérer la gamme complète de services Azure sur lesquels votre équipe s’appuie :
Services de calcul : machines virtuelles, App Service, Container Apps, Azure Kubernetes Service (AKS), Azure Functions, etc.
Services de stockage : stockage Blob, partages de fichiers, disques gérés et comptes de stockage.
Services de mise en réseau : réseaux virtuels, équilibreurs de charge, passerelles d’application et groupes de sécurité réseau.
Services de base de données : Azure SQL Database, Cosmos DB, PostgreSQL, MySQL et Redis.
Supervision et gestion : Azure Monitor, Log Analytics, Application Insights et Resource Manager.
Vous pouvez automatiser n’importe quelle opération de Azure CLI via SRE Agent à l’aide de runbooks, de sous-agents et de crochets d’agent.
Cas d’utilisation principaux
Automatiser les incidents : lorsqu’une alerte se déclenche, l’agent interroge vos outils de surveillance, met en corrélation les signaux entre les systèmes, identifie la cause racine probable et propose des atténuations. Ce processus réduit le temps moyen de récupération (MTTR), améliore la disponibilité du service et intercepte les modèles d’échec avant qu’ils ne deviennent des incidents.
Automatisez les flux de travail planifiés : exécutez des vérifications d’intégrité proactives, des balayages de conformité et des tâches opérationnelles de routine selon une planification définie. Les résultats s’affichent dans votre plateforme d’incidents connectée ou votre canal de notification.
Examinez et conseillez : posez des questions en langage naturel sur votre environnement, telles que « qu’est-ce qui a changé au cours de la dernière heure ? » ou « pourquoi ce service est-il détérioré ? » et obtenez des réponses ancrées avec des citations sources.
Comment fonctionne l’agent SRE ?
L’agent SRE combine une expertise Azure affinée avec des fonctionnalités de personnalisation complètes. Dès sa mise en service, il comprend et gère les ressources Azure grâce à des valeurs par défaut intelligentes pour les tâches opérationnelles courantes.
L’agent fonctionne via cinq primitives d’extension :
Compétences : fonctionnalités discrètes, notamment les runbooks de la Place de marché et les scripts Azure CLI, qui étendent la portée opérationnelle de l'agent sans nécessiter de code personnalisé.
Sous-agents : agents conçus pour des domaines opérationnels spécifiques. Cinq sous-agents sont fournis par défaut (architecture, journaux et métriques, code source, analyse des causes profondes et scan), et vous pouvez créer des sous-agents personnalisés supplémentaires ou les combiner pour des investigations interdomaines.
Python outils : logique personnalisée, transformations de données et intégrations d’API pour les scénarios nécessitant du code plutôt que la configuration.
Serveurs MCP : Connectez-vous à 40 connecteurs prédéfinis (Datadog, Prometheus, Grafana, New Relic, Splunk, Elasticsearch, Dynatrace, AWS CloudWatch, GCP Stackdriver, etc.) ou tout outil personnalisé via la norme model Context Protocol.
Crochets d’agent : automatisations déclenchées par un événement qui s’exécutent à des moments précis du cycle de vie de l’agent, soit avant l’investigation, soit après la résolution. Deux types d’exécuteur sont pris en charge : les hooks de commande exécutent des opérations CLI déterministes, et les hooks de prompt produisent une sortie JSON structurée évaluée par un LLM. Utilisez des hooks pour appliquer des stratégies, émettre des données de télémétrie ou intégrer des flux de travail d’approbation externes. Voir les hooks d'agent.
Un mécanisme d’autorisation contrôle les cinq primitives. Cette couche de sécurité pré-exécution évalue chaque appel d’outil proposé avant son exécution. Les opérateurs peuvent exiger une approbation humaine, appliquer des règles de stratégie ou bloquer les opérations non autorisées, ce qui garantit que votre équipe reste en contrôle même pendant les flux de travail entièrement automatisés. Auditez les itinéraires de télémétrie vers votre propre instance Application Insights pour la visibilité de la conformité.
Pour obtenir la taxonomie primitive complète, y compris les modèles d'étendue RBAC, l'attribution des coûts et les modèles de piste d'audit, consultez les sous-éléments et les crochets d'extensibilité et d'agent.
Connaissance qui ne quitte jamais
Chaque enquête enseigne à votre agent quelque chose de nouveau, et cette connaissance reste même quand vous ne le faites pas. Il capture les causes racines, les étapes de résolution, les préférences et les modèles opérationnels. Si vous êtes le seul qui sait comment fonctionne le système, ce n’est plus un point de défaillance unique. Pour les équipes, les nouveaux membres montent en compétence plus rapidement, la qualité de l'astreinte reste constante, quelle que soit la personne d'astreinte, et votre expertise collective se développe automatiquement.
Tip
Exemple d'équipe : Un nouvel ingénieur intègre l'astreinte. L’agent connaît déjà les modèles de déploiement, les incidents passés et les procédures d’équipe, offrant une qualité cohérente dès le premier jour.
Exemple solo : Tu vas en vacances. L’agent conserve votre contexte opérationnel afin que la personne qui prend le relais ne reparte pas de zéro.
Integrations
Azure SRE Agent s’intègre à votre écosystème opérationnel de la manière suivante :
Surveillance et observabilité :
- Azure Monitor (métriques, journaux, alertes, classeurs)
- Application Insights
- Log Analytics
- Grafana
Gestion des incidents :
- Alertes Azure Monitor
- PagerDuty
- ServiceNow
Contrôle de code source et CI/CD :
- GitHub (référentiels, problèmes)
- Azure DevOps (dépôts, éléments de travail)
Sources de données :
- Clusters de Azure Data Explorer (Kusto)
- Serveurs MCP (Model Context Protocol)
Communication et notifications :
- Slack
- Microsoft Teams
Get started
Commencez à utiliser Azure SRE Agent en planifiant une tâche, en gérant un incident ou en créant un agent personnalisé.
Utilisez des tâches planifiées pour automatiser le travail opérationnel de routine (contrôles d’intégrité, nettoyage et balayages de conformité) sans écrire de code d’infrastructure.
Sélectionnez l’onglet Planifier les tâches .
Entrez les détails de la tâche.
Définissez la planification pour exécuter votre tâche.
Créer des instructions personnalisées pour l'agent chargé de la tâche.
Sélectionnez Créer une tâche planifiée.
Les résultats de votre tâche planifiée s’affichent dans votre plateforme de gestion des incidents connectée ou dans votre canal de notification.
Valeur au fil du temps
L’agent SRE offre une valeur progressive au fur et à mesure qu’il apprend votre environnement, vos modèles et votre historique opérationnel.
| Étape clé | Que se passe-t-il ? |
|---|---|
| Jour 1 | Connectez vos outils, triez votre premier incident et obtenez une valeur de diagnostic immédiate à partir des connaissances Azure intégrées. |
| Semaine 1 | L’agent apprend la topologie de votre environnement, les modèles d’échec courants et les préférences d’escalade. Les enquêtes sont plus rapides et plus précises. |
| Mois 1 | Les connaissances institutionnelles se cumulent. Les équipes signalent qu’elles repèrent les schémas de défaillance avant qu’ils ne s’aggravent. Les nouveaux membres de l'équipe contribuent à partir de leur premier changement d'appel sans aucune connaissance tribale requise. |
Les organisations utilisant Azure agent SRE signalent des réductions significatives du temps de récupération et de la surcharge opérationnelle dans les premiers pilotes.
Évaluer pour votre organisation
Que vous évaluez pour une équipe ou que vous exécutez des opérations en solo, commencez par la table des valeurs progressives de la section précédente. Explorez ensuite :
| Ressource | Ce que vous trouvez |
|---|---|
| Tarification et facturation | Tarification basée sur l’utilisation, éligibilité au niveau gratuit et planification de la capacité |
| Vue d’ensemble de la sécurité | Gestion des données, confidentialité, intégration réseau |
| Créer et configurer | Comment mener un projet pilote structuré |
| Configuration et rôles d’équipe | Rôles d’administrateur et d’utilisateur standard, guide de déploiement par phases |
Considerations
Gardez à l’esprit les considérations suivantes lorsque vous utilisez l’agent Azure SRE :
- L’anglais est la seule langue prise en charge dans l’interface de conversation.
- Pour plus d’informations sur la façon dont Azure SRE Agent gère les données, consultez la politique de confidentialité Microsoft.
- La disponibilité varie selon la configuration de la région et du locataire.
- Les coûts sont basés sur l’utilisation. Consultez tarification et facturation pour le modèle de tarif actuel et les détails du niveau gratuit.
- Comme avec n’importe quel système IA, L’agent SRE peut parfois produire des conclusions incorrectes ou proposer des atténuations qui ne s’appliquent pas à votre environnement. Passez toujours en revue les actions proposées avant d’approuver.
Lorsque vous créez un agent, les ressources suivantes sont également créées automatiquement pour vous :
- Azure Application Insights
- Espace de travail Log Analytics
- Identité managée
Ces ressources prennent en charge l’observabilité de l’agent et la gestion des identités. Vous pouvez les afficher et les gérer dans votre abonnement Azure.