Démarrage rapide : utiliser l’interface de ligne de commande Évaluation de l’agent

L’interface de ligne de commande Microsoft 365 Copilot Agent Evaluations (@microsoft/m365-copilot-eval) vous aide à tester, mesurer et améliorer la qualité de vos agents grâce à une évaluation automatisée des invites et à une notation basée sur l’IA. Ce guide de démarrage rapide vous guide tout au long de l’installation de l’outil Évaluation d’agent, la configuration de votre environnement, la création de votre premier jeu de données et l’exécution d’une évaluation.

Importante

Pour les agents déclaratifs déployés, commencez par les outils de développement Work IQ (préversion) pour un flux de travail guidé. Work IQ Dev Tools gère la version CLI compatible des évaluations d’agents, vous n’avez donc pas besoin de l’installer @microsoft/m365-copilot-eval globalement. Suivez ce guide de démarrage rapide lorsque vous avez besoin d’un contrôle de commande de niveau inférieur ou de gérer un flux de travail existant runevals .

Configuration requise

Avant de commencer, assurez-vous d’avoir les éléments suivants :

  • Un agent Microsoft 365 Copilot déployé sur votre client.
  • Node.js 24.12.0 ou version ultérieure (utiliser node --version pour case activée).
  • Crédits Copilot disponibles dans votre client. L’interface de ligne de commande Évaluation d’agent consomme des crédits Copilot lorsqu’elle envoie des invites de test à votre agent. Votre administrateur client active la facturation basée sur l’utilisation (à l’usage) dans le Centre d’administration Microsoft 365 en accédant au nœud Copilot>Cost Management. Pour plus d’informations, consultez Gérer les crédits Copilot.
  • Un projet Microsoft Foundry avec un modèle GPT-5 déployé pour noter les réponses. Pour plus d’informations, consultez Obtenir des valeurs pour les variables d’environnement.
  • Consentement administrateur de Microsoft Entra accordé pour Work IQ dans votre client. Si vous n’êtes pas un administrateur de client, demandez à votre administrateur d’accorder votre consentement avant de vous exécuter runevals pour la première fois. Pour plus d’informations, consultez Accorder le consentement administrateur.
  • Votre ID de locataire et point de terminaison de projet Microsoft Foundry. Si vous ne disposez pas de ces valeurs, consultez Obtenir des valeurs pour les variables d’environnement.

Remarque

Ce démarrage rapide suppose que vous utilisez un environnement de développement Windows. La prise en charge de l’authentification pour d’autres systèmes d’exploitation sera bientôt disponible.

Étape 1 : Installer l’interface de ligne de commande (CLI)

Installez globalement l’interface de ligne de commande Évaluations de l’agent à l’aide de npm :

npm install -g @microsoft/m365-copilot-eval

Vérifiez l’installation :

runevals --version

Après l’installation, la runevals commande est disponible globalement sur votre système.

Étape 2 : Configurer la structure de votre projet

Exécutez l’outil d’évaluation à partir du répertoire de votre projet d’agent Microsoft 365 (où se trouve le code de votre agent), et non à partir du référentiel de l’outil d’évaluation.

cd /path/to/your-agent-project

Votre projet d’agent doit inclure les fichiers et dossiers suivants :

my-agent/
├── .env.local              # Agent configuration (Agents Toolkit projects)
├── .env.local.user         # Secrets — never committed
├── evals/
│   └── evals.json          # Your test dataset (auto-discovered)
└── .evals/
    └── <generated reports> # Results written here (YYYY-MM-DD_HH-MM-SS.html)

Vous créez le jeu de données à l’étape evals/evals.json 4. Le .evals/ dossier de rapport est créé automatiquement lors de la première exécution.

Étape 3 : configurer des variables d’environnement

Choisissez l’option qui correspond à votre type de projet.

Conseil

Si vous avez créé votre agent à l’aide de Microsoft 365 Agents Toolkit, vous disposez .env.local déjà de la configuration de votre agent. Créez .env.local.user dans la racine de votre projet pour les secrets.

Projets Microsoft 365 Agents Toolkit

Vous ne définissez M365_AGENT_ID pas directement - l’interface de ligne de commande le détecte automatiquement à partir de M365_TITLE_ID dans .env.local. Pour plus d’informations, consultez Obtenir votre ID d’agent.

Ajouter des secrets à .env.local.user:

# .env.local.user (NOT checked in — secrets go here)
TENANT_ID="your-tenant-id-here"
AZURE_AI_PROJECT_ENDPOINT="https://<account>.services.ai.azure.com/api/projects/<project>"
AZURE_AI_MODEL_NAME="gpt-5-mini" # default

L’interface de ligne de commande Évaluation de l’agent note les réponses en utilisant l’évaluation cloud de Microsoft Foundry, qui s’authentifie auprès de Microsoft Entra. Connectez-vous avec l’interface de ligne de commande Azure (az login) avant d’exécuter runevals. Pour plus d’informations sur ces valeurs, consultez Obtenir des valeurs pour les variables d’environnement.

Ajouter .env.local.user à votre .gitignore:

# User-specific secrets — never commit
.env.local.user
env/.env.local.user

Étape 4 : Créer votre premier jeu de données

Créez evals/evals.json avec un petit ensemble d’invites et de réponses attendues. Cet exemple utilise le schéma valide le plus simple pour les évaluations à tour unique.

{
  "schemaVersion": "1.0.0",
  "items": [
    {
      "prompt": "What is Microsoft 365?",
      "expected_response": "Microsoft 365 is a cloud-based productivity suite that includes Office apps, cloud services, and device management."
    },
    {
      "prompt": "How do I share a file in Microsoft Teams?",
      "expected_response": "To share a file in Teams, you can upload it to a channel or chat, or share it from OneDrive with specific permissions."
    }
  ]
}

Conseil

Si vous ignorez cette étape, l’outil propose de générer un fichier de démarrage avec des exemples d’invites la première fois que vous exécutez runevals.

Pour le schéma complet des jeux de données, les catégories et les modèles avancés, consultez Créer des suites de tests d’évaluation.

Étape 5 : Exécuter votre première évaluation

Pour les projets Agents Toolkit (utilise .env.local automatiquement et .env.local.user) :

runevals

Pour les projets non-Agents Toolkit :

runevals --env dev

Étape 6 : confirmer la configuration réussie

Une course réussie produit :

  • Un message de fin dans le terminal similaire au message suivant.

    M365 Copilot Agent Evaluations CLI
    
    Loading environment: dev
    Agent ID: T_my-agent.declarativeAgent
    Using prompts file: ./evals/evals.json
    
    Running evaluations...
    
    Evals completed successfully!
    Results saved to: ./.evals/2026-04-22_14-30-45.html
    
  • Un rapport HTML enregistré dans qui s’ouvre ./.evals/YYYY-MM-DD_HH-MM-SS.html automatiquement dans votre navigateur.

Le rapport inclut des scores pour chaque invite.

Évaluateur Type Échelle Seuil par défaut Par défaut
Importance Basé sur le LLM 1-5 3 Oui
Cohérence Basé sur le LLM 1-5 3 Oui
Ancrage Basé sur le LLM 1-5 3 Non
Similitude Basé sur le LLM 1-5 3 Non
Références Basé sur le nombre > 0 1 Non
ExactMatch Correspondance de chaîne valeur booléenne S/O Non
PartialMatch Correspondance de chaîne 0.0-1.0 0.5 Non

Si vous ne voyez pas ces résultats, consultez Résolution des problèmes.