Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
L’interface de ligne de commande Microsoft 365 Copilot Agent Evaluations (@microsoft/m365-copilot-eval) vous aide à tester, mesurer et améliorer la qualité de vos agents grâce à des évaluations structurées et à des rapports de résultats enrichis avec notation basée sur l’IA.
Importante
Pour les agents déclaratifs déployés, commencez par les outils de développement Work IQ (préversion) pour un flux de travail guidé. Work IQ Dev Tools gère la version CLI des évaluations d’agents compatibles et l’expose via wiqd agent eval. Utilisez les instructions CLI autonomes de cette section lorsque vous avez besoin d’un contrôle de commande de niveau inférieur ou de gérer un flux de travail existant runevals .
Ce que vous pouvez faire
L’outil d’évaluation fournit les fonctionnalités suivantes :
- Exécutez des évaluations par lots et interactives.
- Noter automatiquement les réponses en utilisant l’évaluation cloud de Microsoft Foundry et les métriques intégrées.
- Testez à l’aide de jeux de données JSON, d’invites en ligne ou d’entrées interactives.
- Générez des rapports aux formats HTML, JSON ou CSV.
Métriques d’évaluation
Chaque réponse est notée à l’aide de métriques d’évaluation standard.
| Évaluateur | Type | Échelle | Seuil par défaut | Par défaut |
|---|---|---|---|---|
| Importance | Basé sur le LLM | 1-5 | 3 | Oui |
| Cohérence | Basé sur le LLM | 1-5 | 3 | Oui |
| Ancrage | Basé sur le LLM | 1-5 | 3 | Non |
| Similitude | Basé sur le LLM | 1-5 | 3 | Non |
| RetrievalQuery | Sans LLM | Réussite/échec | S/O | Non |
| RetrievalResult | Sans LLM | Proportionnelle | 1.0 | Non |
| Références | Basé sur le nombre | > 0 | 1 | Non |
| ExactMatch | Correspondance de chaîne | valeur booléenne | S/O | Non |
| PartialMatch | Correspondance de chaîne | 0.0-1.0 | 0.5 | Non |
Pour plus d’informations sur chaque évaluateur, y compris les options de configuration et les ensembles de données échantillons, voir Référence des évaluateurs.
Fonctionnement du flux de travail d’évaluation
Les évaluations suivent un flux de travail cohérent :
- Installez et configurez l’interface de ligne de commande.
- Fournissez la configuration de l’environnement et les informations d’identification.
- Créez un jeu de données d’invites de test.
- Exécutez des évaluations sur votre agent.
- Passez en revue les résultats et itérer.
Variables d’environnement requises
L’outil d’évaluation utilise des variables d’environnement pour vous authentifier et vous connecter à votre client et à votre projet Microsoft Foundry.
| Variable | Description | Par défaut |
|---|---|---|
TENANT_ID |
ID de locataire Microsoft Entra dans lequel votre agent est déployé. | Aucune |
AZURE_AI_PROJECT_ENDPOINT |
Point de terminaison de projet Microsoft Foundry utilisé pour l’évaluation cloud. | Aucune |
AZURE_AI_MODEL_NAME |
Nom de déploiement du modèle dans votre projet Microsoft Foundry. | gpt-5-mini |
M365_TITLE_ID (facultatif) |
ID de titre utilisé pour détecter automatiquement l’ID de l’agent Microsoft 365 pour l’évaluation. | Aucune |
M365_AGENT_ID (facultatif) |
ID d’agent explicite pour l’évaluation. | Détecté automatiquement à partir de M365_TITLE_ID |
Ces valeurs activent l’authentification et permettent à l’outil d’exécuter une évaluation basée sur le LLM en utilisant Microsoft Foundry. Pour plus d’informations sur l’obtention de ces valeurs, consultez Obtenir des valeurs pour les variables d’environnement.