Choix de l’agent hôte

Lorsque vous évaluez la qualité opérationnelle, la fiabilité et le coût, envisagez le choix de l’hôte d’agent, tel que Microsoft 365 Copilot (agents déclaratifs), Copilot Studio (agents personnalisés) ou Azure. Gardez cette décision séparée de la méthode de création de l’assistant. L’exécution ou l’hébergement d’un agent détermine ses capacités d’orchestration, l’accès au modèle et ses fonctionnalités opérationnelles. Ces fonctionnalités affectent directement la qualité de la réponse, les performances et le coût d’exploitation de la solution à grande échelle.

Cet article explique comment les plateformes hôtes d’agents affectent les capacités de la solution. Vous découvrez comment différentes méthodes de création peuvent créer des agents sur la même plateforme hôte tout en conservant une qualité et un comportement cohérents, comment une méthode de création unique peut créer des agents sur différentes plateformes avec des résultats de qualité et de comportement différents, et comment l’hôte forme le profil de coût de la solution.

Coût en tant qu’élément d’opéraabilité

Traitez les coûts comme une caractéristique opérationnelle à état stable, et non comme une question d’approvisionnement ponctuelle. Deux solutions peuvent produire des réponses identiques tout en diffèrent selon un ordre de grandeur de coût, car le coût est piloté par la façon dont l’agent s’exécute, et non seulement ce qu’il retourne. La plateforme hôte détermine en grande partie les marges de manœuvre dont vous disposez :

  • Consommation de jetons par interaction. Chaque instruction, extrait de connaissances et définition d’outil que le modèle traite sur un tour donné est facturée à ce tour. Le contexte permanent chargé à chaque interaction est facturé à chaque interaction, qu’il soit pertinent ou non.
  • Nombre d’itérations du modèle. L’orchestrateur décide combien de fois le modèle est appelé pour effectuer une tâche. Plus de boucles d’appel d’outils et plus de re-planification signifient plus d’inférence.
  • Sélection du modèle. Les modèles de raisonnement plus volumineux coûtent plus cher par jeton et ajoutent une latence. L’hôte détermine quels modèles sont disponibles et si vous pouvez router différentes étapes vers différents modèles.
  • Déterminisme. Le travail déterministe n’a pas besoin de l’inférence de modèle du tout. Le déplacement vers du code ou des actions supprime à la fois le coût du jeton et la variabilité.

Les sections qui suivent décomposent les contrôles qui influencent le plus le coût : le harnais d’orchestration, le choix du modèle et la façon dont vous concevez des instructions et des actions déterministes.

hébergement Microsoft 365 Copilot

Microsoft 365 Copilot fournit un environnement d’hébergement managé pour les agents déclaratifs avec des fonctionnalités intégrées de gouvernance, de sécurité et de conformité. Cette plateforme offre des caractéristiques de performance cohérentes, quel que soit le mode d’écriture utilisé pour créer l’agent.

Par exemple, vous pouvez créer des agents déclaratifs à l’aide de la fonctionnalité Agent Builder dans Microsoft 365 Copilot, Copilot Studio ou Microsoft 365 Kit de ressources Agents. L’agent hôte détermine l’orchestration, le catalogue et les options de modèle de langage disponibles pour le développeur. Ces options sont les plus grands facteurs d’influence sur la qualité des réponses. Les plateformes d'édition et de création devraient être le critère secondaire d'une solution en état stationnaire opérationnel.

Différentes plateformes d’authoring offrent différents niveaux de capacités opérationnelles adaptés aux besoins organisationnels et aux différentes étapes du cycle de développement de l’organisation. Tant que l’hôte de l’agent sous-jacent reste Microsoft 365 Copilot (agents déclaratifs), la qualité reste cohérente à mesure que vous progressez dans différents canevas de création pour répondre à vos besoins opérationnels.

Le tableau suivant résume les considérations concernant la plateforme d’auteur à utiliser pour les agents déclaratifs à titre d’exemple illustratif.

Requirement Fonctionnalité Générateur d’agents dans Copilot Copilot Studio Code professionnel
Propriétaire de la solution Personne Group Entreprise
Mise à jour et maintenance Aucune gestion de version Versionnement avec édition verrouillée Versionnement avec édition simultanée
Cadre d’évaluation Panel d’essais Panneau de test et Code Pro Entièrement personnalisable
CI/CD None Some Oui
Surveillance en temps réel None None Oui
Telemetry Limité Some Entièrement personnalisable
Coût/retour sur investissement Inclus avec Microsoft 365 Copilot Ça va de la licence à la consommation Entièrement personnalisable selon les choix du pro-code
Coût de consommation de Work IQ L’ancrage Work IQ est inclus avec la licence Microsoft 365 Copilot ; les utilisateurs non titulaires d’une licence sont facturés à l’utilisation Consommation basée sur les crédits Copilot (paiement à l’utilisation ou prépayé) Consommation basée sur les crédits Copilot via les API Work IQ ; mesurée et limitée dans le Microsoft 365 admin center

Par exemple, lorsqu’un agent s’appuie sur Work IQ pour le contexte, la récupération ou les actions, cette utilisation fait l’objet d’une facturation variable, le coût en crédits variant selon la complexité du scénario, notamment la taille du contexte, la profondeur du raisonnement et le nombre d’étapes.

Note

Il n’existe aucun abonnement Work IQ distinct, SKU ou licence par utilisateur distincte. Les coûts du Chat et du contexte varient, donc deux assistants similaires peuvent utiliser des quantités de crédits très différentes selon la quantité de contexte sur laquelle ils s’appuient et l’ampleur du raisonnement en plusieurs étapes qu’ils effectuent. Utilisez le tableau de bord de gestion des coûts dans le Microsoft 365 admin center pour surveiller l’utilisation du crédit et définir des limites de dépense pour les locataires, les groupes et les utilisateurs. Les modèles d’optimisation des coûts de l’architecture pour l’optimisation des coûts, ce qui réduit le contexte always-on et déplace le travail déterministe vers des scripts et des actions, permettent de contrôler les dépenses Work IQ.

Considérez d’autres facteurs comme les outils de développement et de débogage (non indiqués dans le tableau). Gardez à l’esprit que ces facteurs sont fortement influencés par la posture de sécurité de votre organisation et sa capacité à s’adapter à une plateforme de développement particulière.

Promouvoir les agents déclaratifs de Microsoft 365 Copilot intégrés dans Agent Builder vers un agent déclaratif créé avec le Microsoft 365 Agents Toolkit. Cette stratégie gère Microsoft 365 Copilot en tant qu’orchestrateur pour garantir un comportement cohérent de l’agent. Si un agent personnalisé expérimental intégré à Copilot Studio répond aux critères d’évaluation de concept et qu’un contrôle de code source est requis pour les opérations d’entreprise, faites passer l’agent à un pipeline managé dans Power Platform. Cette approche garantit que l’orchestrateur Copilot Studio reste le mécanisme principal pour maintenir le comportement de l’agent.

Orchestration et harnais de l’agent

L’orchestrateur ou le harnais est la boucle d’exécution qui planifie les étapes, sélectionne et appelle des outils, gère la fenêtre de contexte et décide quand une tâche est terminée. Il s’agit du principal moteur de la qualité de la réponse et du coût opérationnel, car il contrôle le nombre de tours de modèle, la quantité de contexte cumulée à chaque tour et la façon dont les résultats de l’outil sont renvoyés dans le modèle.

Étant donné que la plateforme hôte fournit l’orchestrateur, la décision de l’hôte résout en grande partie votre enveloppe de coût et de latence :

  • Microsoft 365 Copilot fournit un orchestrateur managé. Vous bénéficiez d’un coût prévisible inclus par licence et d’un comportement cohérent, avec un contrôle limité sur la boucle elle-même.
  • Copilot Studio fournit une orchestration configurable (par exemple, des rubriques et une orchestration générative). Le coût varie d’un modèle basé sur la licence à un modèle basé sur la consommation, selon l’importance du travail génératif que vous confiez au modèle.
  • Azure et pro-code vous donnent un contrôle total sur la boucle. Évaluez le coût de la maintenance du code par rapport à l’utilisation d’un harnais ou d’un sdk bien géré comme Copilot SDK.

Lorsque l’hôte les expose, les leviers d’orchestration clés sont les suivants :

  • Budget par interaction. Limitez ou ajustez le nombre d’itérations de planification et d’appel d’outils que l’orchestrateur prend avant de retourner.
  • Appels d’outils parallèles et séquentiels. Exécutez simultanément des appels d’outils indépendants pour réduire la latence. Consolidez les appels lorsque cela est possible pour réduire les tours.
  • Gestion du contexte. Élaguez, résumez ou limitez la conversation à une fenêtre donnée afin d’éviter que le contexte ne croisse indéfiniment, ce qui permet de maintenir le coût en jetons par tour à un niveau constant au lieu de le laisser s’accumuler.
  • Mise en cache. Réutilisez des préfixes de requête mis en cache entre les interactions ou les sessions pour éviter une nouvelle facturation du contexte stable.

Note

Un orchestrateur plus capable peut augmenter la qualité et le coût en même temps. Adaptez le niveau de sophistication de l’orchestration à la tâche. Un agent de recherche simple n’a pas besoin d’une planification générative en plusieurs étapes, et payer pour cela augmente les coûts sans améliorer les résultats.

Choix du modèle

Le modèle que vous choisissez affecte le coût et la latence par jeton, et il est largement indépendant de la méthode de création. Les modèles de raisonnement plus volumineux fournissent des résultats de meilleure qualité sur des tâches complexes, mais coûtent plus cher par jeton et répondent plus lentement. Faire correspondre le modèle à la difficulté de la tâche au lieu de choisir par défaut l’option la plus capable pour chaque tâche.

Architecte pour le routage des modèles lorsque l’hôte le prend en charge :

  • Réservez des modèles de raisonnement frontière pour des étapes véritablement difficiles, telles que le raisonnement ambigu, la synthèse ou la génération ouverte.
  • Routez des tâches subordonnées déterministes ou simples telles que la classification, l’extraction, la mise en forme et les décisions de routage vers des modèles plus petits, moins chers et plus rapides.
  • Combinez plusieurs modèles au sein d’un seul agent lorsque l’orchestrateur prend en charge la sélection d’un modèle à chaque étape, afin que chaque étape ne paie que pour les capacités dont elle a besoin.

La plateforme hôte détermine quels modèles figurent au catalogue, si vous pouvez effectuer un routage à chaque étape, la taille maximale de la fenêtre de contexte (des fenêtres plus grandes permettent de fournir davantage de contexte, mais coûtent plus cher à chaque échange), et si la mise en cache des prompts est disponible. Validez ces fonctionnalités dans le cadre de la décision de l’hôte, car elles limitent l’optimisation des coûts au niveau du modèle que vous pouvez effectuer ultérieurement.

Architecture pour l’optimisation des coûts

Au-delà de la sélection d’un hôte, d’un orchestrateur et d’un modèle, la façon dont vous structurez les instructions et les actions d’un agent a un impact direct et récurrent sur les coûts. Deux principes guident la conception économique :

  1. Ne payez pas pour l’inférence du modèle pour des tâches déterministes. Regroupez des actions déterministes dans des scripts, des actions ou des connecteurs plutôt que de les décrire comme des instructions en langage naturel que le modèle doit interpréter sur chaque exécution. Le code s’exécute une fois, à moindre coût, avec une sortie prévisible, aucun coût de jeton et moins de variabilité. L’utilisation du langage naturel pour la même procédure coûte inférence à chaque fois et peut produire des résultats incohérents.

  2. Ne payez pas le coût en jetons du contexte permanent pour des instructions que vous utilisez rarement. Les instructions préchargées au niveau de l’agent sont facturées à chaque tour de chaque interaction, même lorsqu’elles sont sans rapport avec la demande de l’utilisateur. Le chargement de conseils et de connaissances à la demande, uniquement lorsque la tâche correspond, signifie que vous payez pour ce contexte lorsqu’elle est réellement utilisée, pas en continu. Ce modèle de divulgation progressive conserve le coût de base de chaque interaction faible.

Le tableau suivant résume quand précharger des instructions dans l’agent et quand confier le travail à des scripts déterministes ou à des ressources à la demande.

Précharger les instructions au niveau de l’agent lorsque… Utilisez des scripts, des actions ou des ressources à la demande quand...
Le comportement s’applique à presque toutes les interactions (rôle principal, ton, garde-fous de sécurité). Le comportement est spécifique à une tâche ou seulement occasionnellement pertinent.
Les conseils sont courts et toujours pertinents. Les conseils sont longs ou soutenus par des informations de référence ou de connaissances volumineuses.
Le modèle a réellement besoin de raisonner ou d’adapter le comportement. L’action est déterministe, reproductible et a une sortie bien définie.
La latence d’une récupération supplémentaire ou d’un appel à un outil nuirait à l’expérience utilisateur. Le coût en jetons lié au maintien du contexte à chaque interaction est supérieur au coût d’un chargement occasionnel.

Un agent économe garde ses instructions permanentes limitées au strict nécessaire et centrées sur l’identité et la sécurité. Il gère les procédures fixes sous forme de scripts ou d’actions et fournit des connaissances spécialisées ainsi que des instructions propres à chaque tâche sous forme de ressources à la demande, chargées uniquement lorsqu’elles sont pertinentes. Cette approche réduit le coût en jetons de chaque interaction, rend le comportement plus prévisible et permet de garder le prompt principal plus concis et plus facile à maintenir, sans perdre en capacités.

Étape suivante

Apprenez à mesurer la qualité des agents, à valider la performance dans divers scénarios et à garantir la préparation opérationnelle avant le déploiement en utilisant des cadres d’évaluation.