Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
L’interface de ligne de commande Microsoft 365 Copilot Agent Evaluations (@microsoft/m365-copilot-eval) vous aide à tester, mesurer et améliorer la qualité de vos agents grâce à une évaluation automatisée des invites et à une notation basée sur l’IA. Ce guide de démarrage rapide vous guide tout au long de l’installation de l’outil Évaluation d’agent, la configuration de votre environnement, la création de votre premier jeu de données et l’exécution d’une évaluation.
Importante
Pour les agents déclaratifs déployés, commencez par les outils de développement Work IQ (préversion) pour un flux de travail guidé. Work IQ Dev Tools gère la version CLI compatible des évaluations d’agents, vous n’avez donc pas besoin de l’installer @microsoft/m365-copilot-eval globalement. Suivez ce guide de démarrage rapide lorsque vous avez besoin d’un contrôle de commande de niveau inférieur ou de gérer un flux de travail existant runevals .
Configuration requise
Avant de commencer, assurez-vous d’avoir les éléments suivants :
- Un agent Microsoft 365 Copilot déployé sur votre client.
-
Node.js 24.12.0 ou version ultérieure (utiliser
node --versionpour case activée). - Crédits Copilot disponibles dans votre client. L’interface de ligne de commande Évaluation d’agent consomme des crédits Copilot lorsqu’elle envoie des invites de test à votre agent. Votre administrateur client active la facturation basée sur l’utilisation (à l’usage) dans le Centre d’administration Microsoft 365 en accédant au nœud Copilot>Cost Management. Pour plus d’informations, consultez Gérer les crédits Copilot.
- Un projet Microsoft Foundry avec un modèle GPT-5 déployé pour noter les réponses. Pour plus d’informations, consultez Obtenir des valeurs pour les variables d’environnement.
- Consentement administrateur de Microsoft Entra accordé pour Work IQ dans votre client. Si vous n’êtes pas un administrateur de client, demandez à votre administrateur d’accorder votre consentement avant de vous exécuter
runevalspour la première fois. Pour plus d’informations, consultez Accorder le consentement administrateur. - Votre ID de locataire et point de terminaison de projet Microsoft Foundry. Si vous ne disposez pas de ces valeurs, consultez Obtenir des valeurs pour les variables d’environnement.
Remarque
Ce démarrage rapide suppose que vous utilisez un environnement de développement Windows. La prise en charge de l’authentification pour d’autres systèmes d’exploitation sera bientôt disponible.
Étape 1 : Installer l’interface de ligne de commande (CLI)
Installez globalement l’interface de ligne de commande Évaluations de l’agent à l’aide de npm :
npm install -g @microsoft/m365-copilot-eval
Vérifiez l’installation :
runevals --version
Après l’installation, la runevals commande est disponible globalement sur votre système.
Étape 2 : Configurer la structure de votre projet
Exécutez l’outil d’évaluation à partir du répertoire de votre projet d’agent Microsoft 365 (où se trouve le code de votre agent), et non à partir du référentiel de l’outil d’évaluation.
cd /path/to/your-agent-project
Votre projet d’agent doit inclure les fichiers et dossiers suivants :
my-agent/
├── .env.local # Agent configuration (Agents Toolkit projects)
├── .env.local.user # Secrets — never committed
├── evals/
│ └── evals.json # Your test dataset (auto-discovered)
└── .evals/
└── <generated reports> # Results written here (YYYY-MM-DD_HH-MM-SS.html)
Vous créez le jeu de données à l’étape evals/evals.json 4. Le .evals/ dossier de rapport est créé automatiquement lors de la première exécution.
Étape 3 : configurer des variables d’environnement
Choisissez l’option qui correspond à votre type de projet.
Conseil
Si vous avez créé votre agent à l’aide de Microsoft 365 Agents Toolkit, vous disposez .env.local déjà de la configuration de votre agent. Créez .env.local.user dans la racine de votre projet pour les secrets.
Projets Microsoft 365 Agents Toolkit
Vous ne définissez M365_AGENT_ID pas directement - l’interface de ligne de commande le détecte automatiquement à partir de M365_TITLE_ID dans .env.local. Pour plus d’informations, consultez Obtenir votre ID d’agent.
Ajouter des secrets à .env.local.user:
# .env.local.user (NOT checked in — secrets go here)
TENANT_ID="your-tenant-id-here"
AZURE_AI_PROJECT_ENDPOINT="https://<account>.services.ai.azure.com/api/projects/<project>"
AZURE_AI_MODEL_NAME="gpt-5-mini" # default
L’interface de ligne de commande Évaluation de l’agent note les réponses en utilisant l’évaluation cloud de Microsoft Foundry, qui s’authentifie auprès de Microsoft Entra. Connectez-vous avec l’interface de ligne de commande Azure (az login) avant d’exécuter runevals. Pour plus d’informations sur ces valeurs, consultez Obtenir des valeurs pour les variables d’environnement.
Ajouter .env.local.user à votre .gitignore:
# User-specific secrets — never commit
.env.local.user
env/.env.local.user
Étape 4 : Créer votre premier jeu de données
Créez evals/evals.json avec un petit ensemble d’invites et de réponses attendues. Cet exemple utilise le schéma valide le plus simple pour les évaluations à tour unique.
{
"schemaVersion": "1.0.0",
"items": [
{
"prompt": "What is Microsoft 365?",
"expected_response": "Microsoft 365 is a cloud-based productivity suite that includes Office apps, cloud services, and device management."
},
{
"prompt": "How do I share a file in Microsoft Teams?",
"expected_response": "To share a file in Teams, you can upload it to a channel or chat, or share it from OneDrive with specific permissions."
}
]
}
Conseil
Si vous ignorez cette étape, l’outil propose de générer un fichier de démarrage avec des exemples d’invites la première fois que vous exécutez runevals.
Pour le schéma complet des jeux de données, les catégories et les modèles avancés, consultez Créer des suites de tests d’évaluation.
Étape 5 : Exécuter votre première évaluation
Pour les projets Agents Toolkit (utilise .env.local automatiquement et .env.local.user) :
runevals
Pour les projets non-Agents Toolkit :
runevals --env dev
Étape 6 : confirmer la configuration réussie
Une course réussie produit :
Un message de fin dans le terminal similaire au message suivant.
M365 Copilot Agent Evaluations CLI Loading environment: dev Agent ID: T_my-agent.declarativeAgent Using prompts file: ./evals/evals.json Running evaluations... Evals completed successfully! Results saved to: ./.evals/2026-04-22_14-30-45.htmlUn rapport HTML enregistré dans qui s’ouvre
./.evals/YYYY-MM-DD_HH-MM-SS.htmlautomatiquement dans votre navigateur.
Le rapport inclut des scores pour chaque invite.
| Évaluateur | Type | Échelle | Seuil par défaut | Par défaut |
|---|---|---|---|---|
| Importance | Basé sur le LLM | 1-5 | 3 | Oui |
| Cohérence | Basé sur le LLM | 1-5 | 3 | Oui |
| Ancrage | Basé sur le LLM | 1-5 | 3 | Non |
| Similitude | Basé sur le LLM | 1-5 | 3 | Non |
| Références | Basé sur le nombre | > 0 | 1 | Non |
| ExactMatch | Correspondance de chaîne | valeur booléenne | S/O | Non |
| PartialMatch | Correspondance de chaîne | 0.0-1.0 | 0.5 | Non |
Si vous ne voyez pas ces résultats, consultez Résolution des problèmes.