Évaluer un assistant (version préliminaire)

[Cet article fait partie de la documentation en version préliminaire et peut faire l’objet de modifications.]

L’onglet Évaluer dans la nouvelle expérience assistant propose des tests structurés et répétables pour votre assistant. Utilisez des évaluations pour mesurer la qualité de l’agent à travers les cas de test, suivre les progrès dans le temps et valider le comportement de votre agent avant de le publier.

Important

Qu’est-ce que l’évaluation des agents ?

L’évaluation d’un assistant vous permet de tester systématiquement les réponses de votre assistant par rapport aux normes de qualité. Au lieu de tester chaque scénario manuellement dans l’onglet Aperçu , créez des évaluations avec des conversations de test, définissez comment mesurer les réponses, et effectuez les évaluations pour obtenir des résultats quantitatifs.

L’évaluation vous aide à répondre à des questions comme celles-ci :

  • L’assistant répond-il correctement dans l’ensemble des scénarios attendus ?
  • Un changement de configuration a-t-il amélioré ou dégradé la qualité des réponses ?
  • L’agent appelle-t-il les outils quand il le faudrait ?

Concepts clés

Les concepts suivants sont clés lors de l’exécution des évaluations dans Copilot Studio :

Conversations

Une conversation est un cas test qui représente un scénario que vous souhaitez que votre assistant gère. Chaque conversation inclut des messages utilisateur et éventuellement des réponses attendues de l’assistant. Organisez les conversations en évaluations. Créez des conversations manuellement, générez-les avec l’IA ou téléchargez-les depuis un fichier CSV.

Évaluations

Une évaluation est un jeu de tests nommé qui combine des conversations avec une méthode de test. Vous créez des évaluations depuis l’onglet Évaluer, vous y ajoutez des conversations, puis vous exécutez les évaluations pour obtenir des résultats notés.

Méthodes de test

Les méthodes de test définissent la manière dont les réponses de l’assistant sont notées. Actuellement, la seule méthode de test disponible est la qualité générale, une évaluation basée sur l’IA pour déterminer si les réponses respectent les normes de qualité, telles que la pertinence et l’exhaustivité.

Note

La méthode générale de test de qualité ne compare pas les réponses aux réponses attendues.

Profil utilisateur

Les évaluations sont exécutées sous un profil utilisateur. Gérez quel profil authentifié effectue l’évaluation afin que les outils et connexions de l’agent soient entièrement vérifiables.

Workflow d’évaluation

Suivez ces étapes pour évaluer un agent :

  1. Créez une évaluation : sur l’onglet Évaluer, commencez une nouvelle évaluation. En savoir plus dans Créer un ensemble de tests pour un agent.
  2. Ajouter des conversations : ajoutez des conversations de test en les écrivant manuellement, en les générant avec l’IA ou en chargeant un fichier CSV.
  3. Configurer : nommez l’évaluation, sélectionnez une méthode de test, choisissez la version de l’assistant et définissez le profil utilisateur.
  4. Lancez l’évaluation : sélectionnez Évaluer pour effectuer le test et attendez les résultats. En savoir plus dans Lancer une évaluation pour un agent.
  5. Vérifiez les résultats : analysez les scores et identifiez les points à améliorer. En savoir plus dans Voir les résultats d’évaluation d’un agent.
  6. Itère : Ajustez les instructions, connaissances ou outils de votre agent, puis relancez l’évaluation pour mesurer l’impact.