Note de transparence de l’agent d’opérations

Qu’est-ce qu’une note de transparence ?

Un système d’INTELLIGENCE artificielle inclut non seulement la technologie, mais aussi les personnes qui l’utilisent, les personnes qui sont affectées par elle et l’environnement dans lequel il est déployé. La création d’un système adapté à l’objectif visé exige de bien comprendre comment fonctionne la technologie, quelles sont ses capacités et limites et comment atteindre les meilleures performances. Les notes de transparence Microsoft vous aident à comprendre le fonctionnement de notre technologie IA, les choix que les propriétaires du système peuvent faire qui influencent les performances et le comportement du système, ainsi que l’importance de réfléchir à l’ensemble du système, y compris la technologie, les personnes et l’environnement. Utilisez des notes de transparence lors du développement ou du déploiement de votre propre système, ou partagez-les avec les personnes qui utilisent ou sont affectées par votre système.

Les notes de transparence Microsoft font partie d’un effort plus large de Microsoft pour mettre en pratique nos principes d’IA. Pour plus d’informations, consultez les principes de l’IA Microsoft.

Principes de base de l’agent d’opérations Real-Time Intelligence

Présentation

L’agent d’opérations Real-Time Intelligence est une plateforme permettant de créer des agents qui surveillent les flux de données, détectent les anomalies ou les conditions et recommandent des actions basées sur des événements réels. Ces agents automatisent les tâches, fournissent des insights et prennent en charge la prise de décision en temps voulu. En configurant des objectifs métier, des sources de connaissances, des actions et des instructions, l’agent crée un plan pour suivre les objectifs, surveiller les données et appliquer des règles pour détecter les conditions. L’agent avertit les utilisateurs des actions recommandées si des conditions appropriées se produisent.

Termes clés

  • Source de connaissances : connexion de base de données que l’agent peut utiliser pour rechercher et surveiller les données.

  • Outil : fonctionnalité intégrée qui permet à l’agent d’effectuer des tâches, telles que la génération de requêtes structurées à partir du langage naturel, l’exécution de la détection d’anomalies et l’envoi de messages électroniques ou Microsoft Teams.

  • Thread : session de conversation entre un agent et un utilisateur. Les threads stockent les messages et gèrent automatiquement la troncation pour ajuster le contenu dans le contexte d’un modèle.

  • Playbook : représentation interne de l’agent des entités, des données, des règles et des actions possibles qui forment son manuel d’exploitation.

  • Entité : objet de votre entreprise que l’agent surveille. Par exemple, dans une entreprise de location de vélos, des vélos et des stations d’ancrage peuvent être des entités pertinentes. Dans la gestion des aéroports, les lignes d’enregistrement, les points de contrôle de sécurité et les passagers sont des entités pertinentes.

  • Instances : occurrences spécifiques d’une entité, telles que Bike 0451 ou Flight MS1234.

  • Règles : conditions ou modèles dans les données que l’agent surveille avant d’effectuer des recommandations.

  • Règles autonomes : des règles qui ont des actions associées que l'agent est autorisé à effectuer sans nécessiter d'abord de confirmation humaine.

Capacités

Comportement du système

Lorsque vous créez un agent d’opérations, vous configurez les paramètres suivants : objectifs métier, sources de connaissances, actions possibles et instructions. Avec ces entrées, l’agent utilise des modèles de langage volumineux (LLMs) pour créer un playbook d’entités, de données mappées et de règles à surveiller. Vous pouvez affiner le modèle en ajustant les objectifs et les instructions. Lorsque vous activez l’agent, l’agent surveille les données en arrière-plan. Lorsque les conditions correspondent aux règles, elles analysent les données, identifient la cause et recommandent des actions pour atteindre les objectifs métier.

L'agent vous avertit via Teams avec des alertes en langage naturel, en vous tenant informé pour les recommandations initiales. Vous pouvez approuver, rejeter ou rendre la règle autonome, ce qui permet à l’agent d’agir sans confirmation supplémentaire.

Comme l’agent utilise des LLM pour créer le playbook de l’agent et recommander des actions, vous devez :

  • Examinez attentivement le modèle de comportement avant de démarrer l’agent.

  • Surveillez attentivement les recommandations de l’agent et confirmez le raisonnement qu’il utilise pour faire des recommandations avant d’agir.

  • Examinez attentivement les règles autonomes que vous créez avec l’agent. Ces règles entraînent automatiquement l’action.

Cas d’utilisation

Utilisations prévues

Vous pouvez utiliser des agents d’opérations dans différents scénarios. Les utilisations prévues du système sont les suivantes :

  • Gestion de la location de vélos : vous pouvez configurer l’agent d’exploitation pour surveiller continuellement la disponibilité des vélos à différentes stations à l’aide de données en temps réel. Définissez un objectif pour garantir la disponibilité des vélos, afin qu’il trouve les requêtes appropriées pour suivre cette valeur pour chaque station d’ancrage.

  • Optimisation de l’éolienne : l’agent surveille les données provenant de parcs éoliens, le suivi des métriques telles que la sortie de l’énergie et l’angle des lames. Il recherche des anomalies ou des baisses de puissance et recommande des ajustements aux paramètres d’exploitation.

  • Équilibrage de l’inventaire de l’entrepôt : l’agent surveille les niveaux de stock sur plusieurs entrepôts en temps réel. Définissez un objectif pour maintenir une distribution optimale des stocks et éviter les stocks ou le surstockage.

  • Surveillance des dépenses : donnez à l’agent l’accès aux données sur les demandes de dépenses et les rapports. Demandez-lui d’indiquer les dépenses qui ne sont pas conformes aux règles courantes et de repérer les anomalies dans des modèles à long terme pour chaque employé ou centre de coûts.

  • Automatisation de la réponse aux incidents : l’agent surveille les journaux et les données de télémétrie de l’infrastructure informatique pour détecter les signes de dégradation du service ou d’anomalies de sécurité. Son objectif est de réduire le temps moyen de détection (MTTD) et le temps moyen de résolution (MTTR).

Aspects à prendre en considération lors du choix d’autres cas d’utilisation

Nous vous encourageons à appliquer des agents d’exploitation dans vos solutions ou applications innovantes. Toutefois, tenez compte des facteurs suivants pour vous assurer que l’agent convient à votre cas d’usage spécifique :

  • Évitez les scénarios où l’utilisation ou l’utilisation abusive du système pourrait entraîner des blessures physiques ou psychologiques importantes à un individu. Par exemple, les scénarios qui diagnostiquent des patients ou prescrivent des médicaments peuvent causer des dommages importants.

  • Évitez les scénarios où l’utilisation ou l’utilisation abusive du système pourrait avoir un impact conséquent sur les opportunités de vie ou le statut juridique. Par exemple, les scénarios où le système ou l’agent d’IA pourrait affecter le statut juridique d’un individu, les droits juridiques ou son accès au crédit, à l’éducation, à l’emploi, à la santé, au logement, aux prestations sociales, aux services, aux opportunités ou aux conditions sur lesquelles ils sont fournis.

  • Évitez les scénarios à enjeux élevés susceptibles d’entraîner des dommages. Le modèle utilisé dans un agent peut refléter certains points de vue, préjugés et autres contenus indésirables présents dans les données d’entraînement ou les exemples fournis dans l’indication. Par conséquent, nous nous mettons en garde contre l’utilisation d’agents dans des scénarios à enjeux élevés où un comportement injuste, non fiable ou offensant peut être coûteux ou entraîner des dommages.

  • Examinez soigneusement les cas d’usage dans un domaine ou un secteur d’intérêt élevé où les actions de l’agent sont irréversibles ou très conséquentes. Ces industries incluent, mais ne sont pas limitées aux domaines médicaux, médicaux, financiers ou juridiques.

  • Considérations juridiques et réglementaires. Les entreprises doivent évaluer les obligations légales et réglementaires spécifiques potentielles lors de l’utilisation de services et solutions d’IA, qui peuvent ne pas convenir à tous les secteurs ou scénarios. Les restrictions peuvent varier en fonction des exigences réglementaires régionales ou locales. En outre, les services ou solutions IA ne sont pas conçus pour et peuvent ne pas être utilisés de manière interdite dans les conditions de service applicables et les codes de conduite pertinents.

Limites

Limitations techniques, facteurs opérationnels et plages

  • Malgré une formation intensive d’OpenAI et l’implémentation de contrôles d’IA responsables par Microsoft, les services IA sont fallibles et probabilistes. Cette limitation complique le blocage complet de tout contenu inapproprié, ce qui entraîne des préjugés potentiels, des stéréotypes ou une non-base dans le contenu généré par l’IA. Pour plus d’informations sur les limitations connues du contenu généré par l’IA, consultez la note de transparence pour Azure OpenAI, qui inclut des références aux machines virtuelles llms derrière les agents d’exploitation.

  • Vous pouvez donner aux agents d’opérations un large éventail d’instructions et d’objectifs. La nature probabiliste des modèles de comportement LLM signifie que vous ne pourrez peut-être pas aligner les agents avec vos besoins. La description du modèle de comportement de l’agent est également générée à l’aide de l’IA, ce qui peut ne pas être entièrement exact.

  • Pour utiliser efficacement les agents d’exploitation, vous devez former pour interagir efficacement avec le service et en tirer parti.

  • Les modèles IA avancés nécessitent des ressources de calcul importantes, ce qui peut avoir un impact sur les performances, en particulier dans les environnements à contrainte de ressources. Vous pouvez rencontrer des problèmes de latence ou de performances pendant les pics d’utilisation.

  • Étant donné que les agents combinent des llMs avec des systèmes externes, il peut être difficile de comprendre pourquoi il a choisi certains outils ou combinaisons d’outils pour répondre à une requête. Ce défi complique la confiance envers et la vérification des résultats ou actions de l’agent.

  • Les organisations doivent prendre en compte leurs obligations légales et de conformité particulières lors de l’utilisation d’agents d’exploitation, en particulier dans les industries réglementées. Microsoft examine les exigences réglementaires qui s’appliquent à Microsoft en tant que fournisseur de la technologie et les traite au sein du produit par le biais d’un processus d’amélioration continue.

  • Grâce à l’expérience utilisateur de l’agent, vous pouvez interrompre ou arrêter rapidement l’agent à tout moment. Cette action arrête la surveillance des nouvelles données et toutes les nouvelles actions que l’agent peut recommander ou entreprendre. Les actions que l’agent a appelées dans d’autres systèmes (par exemple, le démarrage d’un workflow Power Automate) peut ne pas s’arrêter immédiatement. L’agent lance ces actions en tant que processus indépendants que vous devez gérer dans ces autres expériences de produit.

  • Les messages entre l’agent et l’utilisateur sont remis via Teams. Lorsque vous envoyez des messages à l’agent, Azure Bot Service traite les messages. L’utilisation d’Azure AI Bot Service présente une limitation technique selon laquelle chaque bot ne peut avoir qu’un seul point de terminaison global. Pour les bots internes Teams, les demandes sont envoyées au point de terminaison global, puis redirigées vers un point de terminaison régional près de l’utilisateur. Les agents d’exploitation utilisent un point de terminaison situé dans l’UE, ce qui signifie que vos données utilisateur peuvent être déplacées en dehors de votre région géographique pour le traitement.

Niveau de performance du système

Dans les systèmes IA, les performances sont souvent liées à la précision (fréquence à laquelle le système fournit des sorties correctes). Pour les agents d’opérations, les performances sont plus flexibles, car les utilisateurs peuvent interpréter les sorties différemment. Les erreurs se produisent généralement lorsque l’agent ne comprend pas les objectifs, les données ou les entités clés dans le processus métier. Lorsque l’agent émet des recommandations, les utilisateurs doivent examiner attentivement le contexte fourni avant d’approuver des actions.

Meilleures pratiques pour améliorer les performances du système

Pour obtenir les meilleurs résultats avec les agents d’opérations, concentrez-vous sur la création d’invites détaillées et bien structurées. Les objectifs et les instructions que vous fournissez aident l’agent à identifier les points de données et les règles appropriés pour la surveillance des modifications au fil du temps. Améliorez la précision en définissant explicitement les valeurs et conditions de données que l’agent doit surveiller. Décrivez clairement comment les actions influencent les résultats et comment les valeurs surveillées sont censées changer.

Les données de haute qualité sont tout aussi importantes. Assurez-vous que les structures de données sont bien organisées, avec des noms de colonnes significatifs au lieu de valeurs codées. Aplatir les données d’événement imbriquées si possible. Cette structure permet à l’agent de localiser et de surveiller efficacement les informations pertinentes.

Évaluation des agents d’exploitation

Méthodes d’évaluation

La plateforme de l’agent d’exploitation utilise un processus rigoureux et multistage pour évaluer la précision, la sécurité et l’amélioration continue. Au cœur se trouve un cycle en trois étapes : tracer>itérer>évaluer. Ce cycle commence par implémenter la télémétrie pour surveiller les processus décisionnels de l’agent, notamment la planification, la formation de l’ontologie, la mise à l’échelle des données, la génération de règles et l’exécution. Les jeux de données d’évaluation proviennent de cas d’usage réels et de données synthétiques qui introduisent la variabilité. Vous mesurez des métriques telles que la précision, la convergence, les taux d’échec et la sécurité tout au long du cycle de vie de l’agent, du développement à la production.

L’environnement d’évaluation reflète les conditions de production et met l’accent sur la séparation entre les pipelines de développement et d’évaluation pour éviter les biais. Vous organisez manuellement les jeux de données initiaux et définissez les ontologies et sorties attendues à l’avance. Plus tard, vous mettez à l’échelle ces jeux de données à l’aide de la génération synthétique. Les jeux de données se concentrent sur les objectifs opérationnels pertinents pour la surveillance et la prise de décision de l’entreprise. Bien qu’ils représentent des scénarios réels, ils n’incluent pas encore des populations d’utilisateurs plus larges ou des configurations d’objectifs dynamiques. Cette approche maintient les évaluations axées, reproductibles et alignées sur les principes d’IA responsables.

Résultats de l’évaluation

Nos processus d’évaluation utilisent une méthodologie structurée de trace>, itération> et évaluation. Nous incorporant des évaluations à chaque étape des boucles de prise de décision de l’agent. Ces évaluations ont confirmé que l’agent produit constamment des ontologies précises, génère des requêtes valides et pertinentes, puis sélectionne les actions appropriées alignées sur les objectifs de l’utilisateur. Ces résultats prennent en charge l’alignement du système avec les objectifs de responsabilité, en particulier en s’assurant qu’il s’exécute comme prévu dans des contextes opérationnels réels.

Les jeux de données d’entraînement et de test utilisés dans l’évaluation ont été soigneusement organisés pour refléter un large éventail de scénarios opérationnels. Vous avez construit manuellement des jeux de données initiaux à partir de cas d’usage réels, avec des sorties attendues clairement définies, notamment des ontologies et des résultats de requête. Plus tard, vous avez développé ces jeux de données à l’aide de la génération synthétique pour augmenter la variabilité et la couverture. Vous avez conçu les jeux de données pour représenter les types d’objectifs et d’environnements de données que l’agent doit rencontrer, y compris les variations de complexité du schéma, la disponibilité des données et l’intention de l’utilisateur. Cette approche a assuré que l’évaluation a capturé une gamme représentative de facteurs opérationnels et de paramètres, prenant en charge le développement et le déploiement responsables du système.

Les résultats de l’évaluation ont influencé plusieurs contraintes de conception clés dans le système. Par exemple, nous avons introduit des limites sur la taille maximale des requêtes et la complexité minimale de l’ontologie pour garantir des performances cohérentes et réduire les taux d’échec. Bien que les résultats soient largement applicables à de nombreux scénarios de surveillance opérationnelle et de prise de décision, l’évaluation initiale n’incluait pas certains domaines, tels que la reconfiguration des objectifs dynamiques et la collaboration multi-agent. Ces domaines représentent des opportunités de test et de développement futurs.

Évaluation et intégration d’agents d’exploitation pour votre utilisation

Le comportement d’un agent est mis en forme par les instructions, les objectifs, les données et les actions que vous fournissez. Les invites précises et les données bien organisées avec des noms de colonnes intuitifs améliorent la précision et réduisent les erreurs.

Après avoir configuré l’agent, validez les modèles et règles comportementaux de l’agent en examinant les requêtes KQL pour garantir l’alignement avec les processus métier. Bien que les conditions basées sur des règles déclenchent l’agent, ses recommandations issues du modèle de langage peuvent contenir des imprécisions. C'est pourquoi il est important de vérifier toujours les résultats avant d’agir.

Les agents hautement réactifs peuvent entraîner des notifications excessives ou une surutilisation d’actions automatisées, ce qui peut entraîner une instabilité du système. Pour atténuer les risques, ajuster les règles, effectuer des audits réguliers, simuler des cas de périphérie et concevoir des interfaces qui favorisent la transparence. Par exemple, affichez des scores de confiance et des explications claires pour les recommandations.