Évaluation d’agent Vue d’ensemble de CLI

L’interface de ligne de commande Microsoft 365 Copilot Agent Evaluations (@microsoft/m365-copilot-eval) vous aide à tester, mesurer et améliorer la qualité de vos agents grâce à des évaluations structurées et à des rapports de résultats enrichis avec notation basée sur l’IA.

Importante

Pour les agents déclaratifs déployés, commencez par les outils de développement Work IQ (préversion) pour un flux de travail guidé. Work IQ Dev Tools gère la version CLI des évaluations d’agents compatibles et l’expose via wiqd agent eval. Utilisez les instructions CLI autonomes de cette section lorsque vous avez besoin d’un contrôle de commande de niveau inférieur ou de gérer un flux de travail existant runevals .

Ce que vous pouvez faire

L’outil d’évaluation fournit les fonctionnalités suivantes :

  • Exécutez des évaluations par lots et interactives.
  • Noter automatiquement les réponses en utilisant l’évaluation cloud de Microsoft Foundry et les métriques intégrées.
  • Testez à l’aide de jeux de données JSON, d’invites en ligne ou d’entrées interactives.
  • Générez des rapports aux formats HTML, JSON ou CSV.

Métriques d’évaluation

Chaque réponse est notée à l’aide de métriques d’évaluation standard.

Évaluateur Type Échelle Seuil par défaut Par défaut
Importance Basé sur le LLM 1-5 3 Oui
Cohérence Basé sur le LLM 1-5 3 Oui
Ancrage Basé sur le LLM 1-5 3 Non
Similitude Basé sur le LLM 1-5 3 Non
RetrievalQuery Sans LLM Réussite/échec S/O Non
RetrievalResult Sans LLM Proportionnelle 1.0 Non
Références Basé sur le nombre > 0 1 Non
ExactMatch Correspondance de chaîne valeur booléenne S/O Non
PartialMatch Correspondance de chaîne 0.0-1.0 0.5 Non

Pour plus d’informations sur chaque évaluateur, y compris les options de configuration et les ensembles de données échantillons, voir Référence des évaluateurs.

Fonctionnement du flux de travail d’évaluation

Les évaluations suivent un flux de travail cohérent :

  1. Installez et configurez l’interface de ligne de commande.
  2. Fournissez la configuration de l’environnement et les informations d’identification.
  3. Créez un jeu de données d’invites de test.
  4. Exécutez des évaluations sur votre agent.
  5. Passez en revue les résultats et itérer.

Variables d’environnement requises

L’outil d’évaluation utilise des variables d’environnement pour vous authentifier et vous connecter à votre client et à votre projet Microsoft Foundry.

Variable Description Par défaut
TENANT_ID ID de locataire Microsoft Entra dans lequel votre agent est déployé. Aucune
AZURE_AI_PROJECT_ENDPOINT Point de terminaison de projet Microsoft Foundry utilisé pour l’évaluation cloud. Aucune
AZURE_AI_MODEL_NAME Nom de déploiement du modèle dans votre projet Microsoft Foundry. gpt-5-mini
M365_TITLE_ID (facultatif) ID de titre utilisé pour détecter automatiquement l’ID de l’agent Microsoft 365 pour l’évaluation. Aucune
M365_AGENT_ID (facultatif) ID d’agent explicite pour l’évaluation. Détecté automatiquement à partir de M365_TITLE_ID

Ces valeurs activent l’authentification et permettent à l’outil d’exécuter une évaluation basée sur le LLM en utilisant Microsoft Foundry. Pour plus d’informations sur l’obtention de ces valeurs, consultez Obtenir des valeurs pour les variables d’environnement.