Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
L’interface de ligne de commande Microsoft 365 Copilot Agent Evaluations comprend un ensemble d’évaluateurs qui notent automatiquement les réponses de votre agent. Chaque évaluateur mesure un aspect différent de la qualité, de la pertinence sémantique à la correspondance exacte des chaînes. Cet article décrit chaque évaluateur, son comportement de notation, ses options de configuration et comment l’utiliser dans vos jeux de données de test.
Pour plus d’informations sur la configuration des évaluateurs dans vos jeux de données, consultez Configurer les évaluateurs.
Vous trouverez le schéma du jeu de données d’évaluation au format JSON sur GitHub.
Résumé de l’évaluateur
Le tableau suivant résume tous les évaluateurs disponibles.
| Évaluateur | Type | Échelle | Seuil par défaut | Activé par défaut | Champs obligatoires |
|---|---|---|---|---|---|
| Importance | Basé sur le LLM | 1-5 | 3 | Oui | prompt |
| Cohérence | Basé sur le LLM | 1-5 | 3 | Oui | prompt |
| Ancrage | Basé sur le LLM | 1-5 | 3 | Non | prompt |
| Similitude | Basé sur le LLM | 1-5 | 3 | Non |
prompt, expected_response |
| RetrievalQuery | Sans LLM | Réussite/échec | S/O | Non |
prompt, Configuration de l’évaluateur |
| RetrievalResult | Sans LLM | Proportionnelle | 1.0 | Non |
prompt, Configuration de l’évaluateur |
| Références | Basé sur le nombre | > 0 | 1 | Non | prompt |
| PartialMatch | Correspondance de chaîne | 0.0-1.0 | 0.5 | Non |
prompt, expected_response |
| ExactMatch | Correspondance de chaîne | Booléen | S/O | Non |
prompt, expected_response |
Évaluateurs basés sur le LLM
Les évaluateurs basés sur le LLM utilisent un modèle Azure OpenAI dans votre projet Microsoft Foundry (configuré via vos variables d’environnement) pour juger de la qualité de la réponse de l’agent. Ces évaluateurs sont optimisés par le Kit de développement logiciel (SDK) d’évaluation d’Azure AI. Les scores vont de 1 à 5 sur une échelle de Likert, où des valeurs plus élevées indiquent une meilleure qualité. Par défaut, un score de 3 ou plus est requis pour réussir. Vous pouvez modifier le score requis dans votre configuration de test.
Importance
L’évaluateur de pertinence évalue la façon dont la réponse de l’agent répond à la requête de l’utilisateur. Il évalue si la réponse répond directement et complètement à la question posée.
- Activé par défaut : Oui
- Échelle : 1-5 (Likert)
- Seuil par défaut : 3
-
Champs obligatoires :
prompt - Vérité de terrain requise : Non
L’évaluateur de pertinence ne nécessite expected_response pas d’évaluation de la relation entre la requête et la réponse uniquement.
Pertinence : échantillon de jeu de données
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Relevance": {}
},
"items": [
{
"prompt": "What are the key features of our enterprise plan?",
"expected_response": "The enterprise plan includes advanced security, unlimited storage, 24/7 support, and custom integrations."
}
]
}
Cohérence
L’évaluateur de cohérence mesure la présentation logique et ordonnée des idées dans la réponse de l’agent. Il évalue si la réponse a des liens clairs entre les phrases, des transitions appropriées et une séquence logique d’idées facile à suivre.
- Activé par défaut : Oui
- Échelle : 1-5 (Likert)
- Seuil par défaut : 3
-
Champs obligatoires :
prompt - Vérité de terrain requise : Non
Jeu de données d’exemple de cohérence
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Coherence": {}
},
"items": [
{
"prompt": "Explain the process for submitting an expense report.",
"expected_response": "To submit an expense report, first collect your receipts. Then open the expense portal, create a new report, attach your receipts, and submit for manager approval."
}
]
}
Ancrage
L’évaluateur Groundedness vérifie si la réponse de l’agent est cohérente et soutenue par le contexte d’ancrage fourni. Il se concentre sur la précision en vérifiant que la réponse ne contient pas de revendications ou d’informations qui vont au-delà de ce que les documents récupérés prennent en charge.
- Activé par défaut : Non
- Échelle : 1-5 (Likert)
- Seuil par défaut : 3
-
Champs obligatoires :
prompt,expected_response - Vérité de terrain requise : Non
Utilisez l’évaluateur Groundedness pour détecter les hallucinations ou les affirmations non étayées dans les réponses de votre agent.
Exemple de jeu de données Groundedness
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Relevance": {},
"Groundedness": {}
},
"items": [
{
"prompt": "What is our company's remote work policy?",
"expected_response": "Employees can work remotely up to 3 days per week with manager approval."
}
]
}
Similitude
L’évaluateur de similarité mesure le degré de similitude sémantique entre la réponse de l’agent et une (vérité de terrain) fournie expected_response . Contrairement aux mesures de chevauchement de jetons telles que F1 ou Bilingual Evaluation Understudy (BLEU), il se concentre sur le sens et le contexte plus large plutôt que sur les correspondances de mots au niveau de la surface.
- Activé par défaut : Non
- Échelle : 1-5 (Likert)
- Seuil par défaut : 3
-
Champs obligatoires :
prompt,expected_response - Vérité de terrain requise : Oui
Vous devez configurer expected_response dans votre jeu de données des éléments pour l’évaluateur de similarité.
Similarity sample dataset
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Similarity": {}
},
"items": [
{
"prompt": "What is Microsoft Graph?",
"expected_response": "Microsoft Graph is a unified API endpoint that provides access to data and intelligence in Microsoft 365 services."
}
]
}
Évaluateurs de récupération
Les évaluateurs de récupération valident le pipeline de récupération de bout en bout de votre agent Microsoft 365 Copilot. Ils inspectent la façon dont l’agent traduit les requêtes utilisateur en opérations d’extraction et si les ressources attendues apparaissent dans les résultats. Ces évaluateurs n’utilisent pas de juge LLM - ils effectuent des contrôles déterministes sur les données d’exécution de la récupération.
RetrievalQuery
L’évaluateur RetrievalQuery valide que Copilot a correctement traduit l’intention de l’utilisateur en requêtes de récupération. Il inspecte les queryString valeurs dans le normalisé retrieval_executions[] et vérifie qu’elles correspondent aux modèles attendus.
- Activé par défaut : Non
- Mettre à l’échelle : Réussite/échec
- Seuil par défaut : Non applicable
-
Champs obligatoires :
prompt, configuration de l’évaluateur - Vérité de terrain requise : Non
Options de configuration de RetrievalQuery
| Option | Type | Requis | Description |
|---|---|---|---|
capability |
string | Oui | La capacité de récupération pour définir l’étendue des exécutions examinées (par exemple, "OneDriveAndSharePoint", "GraphConnectors""Email", ). |
selector |
string | Oui | Sous-chaîne insensible à la casse utilisée pour identifier la requête cible dans les exécutions de récupération. |
includes |
string | Oui | Sous-chaînes qui DOIVENT toutes apparaître dans la requête correspondante. |
excludes |
string | Oui | Sous-chaînes qui NE DOIVENT PAS apparaître dans la requête correspondante. |
Exemple de jeu de données RetrievalQuery
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Find the Q4 sales report in SharePoint",
"expected_response": "Here is the Q4 sales report.",
"evaluators": {
"RetrievalQuery": {
"capability": "OneDriveAndSharePoint",
"selector": "Q4 sales report",
"includes": ["projections", "profit"],
"excludes": ["FileType:OneNote"]
}
}
}
]
}
RetrievalResult
L’évaluateur RetrievalResult valide que les ressources attendues apparaissent réellement dans les documents, les messages et les éléments renvoyés par les exécutions de récupération. Il vérifie si des extraits de texte spécifiques sont présents dans les extraits de résultats de récupération dans un seuil de classement configurable.
- Activé par défaut : Non
- Mettre à l’échelle : Proportionnel (0,0-1,0)
- Seuil par défaut : 1,0 (toutes les vérifications doivent réussir)
-
Champs obligatoires :
prompt, configuration de l’évaluateur - Vérité de terrain requise : Non
Le score est proportionnel au nombre d’objets attendus trouvés. Par exemple, si 2 des 3 éléments attendus sont trouvés, le score est de 0,67. Toutefois, une réussite nécessite toutes les vérifications pour réussir (le seuil est toujours de 1,0). Vous devez configurer au moins l’un des éléments suivants ou expected_itemsmin_expected_count.
Options de configuration de RetrievalResult
| Option | Type | Requis | Description |
|---|---|---|---|
expected_items |
tableau | Conditionnel | Tableau d’objets spécifiant les résultats attendus. Chaque objet peut inclure retrievalExtract_contains (un extrait de texte à mettre en correspondance dans les extraits de l’accès de récupération). Vous devez configurer au moins l’un des éléments suivants ou expected_itemsmin_expected_count. |
expected_items[].retrievalExtract_contains |
string | Non | Un extrait de texte qui doit apparaître dans un extrait de l’accès de récupération. |
min_expected_count |
entier | Conditionnel | Nombre minimal de résultats qui doivent être récupérés. Vous devez configurer au moins l’un des éléments suivants ou expected_itemsmin_expected_count. |
max_rank |
entier | Non | Position de classement maximale à prendre en compte lors de la mise en correspondance des objets attendus. La valeur par défaut est 10. |
RetrievalResult exemple de jeu de données
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Find recent emails about the Contoso project",
"expected_response": "Here are the recent emails about the Contoso project.",
"evaluators": {
"RetrievalResult": {
"expected_items": [
{ "retrievalExtract_contains": "update" },
{ "retrievalExtract_contains": "budget" }
],
"max_rank": 5,
"min_expected_count": 2
}
}
}
]
}
Évaluateurs basés sur des chaînes et des nombres
Ces évaluateurs utilisent une logique déterministe d’appariement ou de comptage de chaînes. Ils ne nécessitent pas de LLM et s’exécutent localement.
Références
L’évaluateur de citations compte le nombre de références de citation dans la réponse de l’agent, telles que [1], [2]ou des citations de type lien hypertexte. Il vérifie que l’agent attribue correctement ses revendications aux sources. Définissez le seuil du nombre de citations attendu.
- Activé par défaut : Non
- Mettre à l’échelle :>= 0 (nombre)
- Seuil par défaut : 1
-
Champs obligatoires :
prompt - Vérité de terrain requise : Non
Le score est égal au nombre de citations, et un minimum de 1 citation est requis pour réussir par défaut.
Options de configuration des citations
| Option | Type | Requis | Description |
|---|---|---|---|
citation_format |
string | Non | Spécifie le format de citation attendu, tel que "mixed". |
Exemple de jeu de données de citations
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "What is our return policy?",
"expected_response": "Our return policy allows returns within 30 days [1].",
"evaluators": {
"Citations": {
"threshold": 2,
"citation_format": "mixed"
}
}
}
]
}
PartialMatch
L’évaluateur PartialMatch mesure le degré de chevauchement textuel entre la réponse de l’agent et l’utilisation de la expected_response similarité au niveau du jeton (analogue à une approche de score F1). Cet évaluateur est utile si vous vous attendez à ce que la réponse contienne des phrases clés ou des informations de la réponse attendue, mais que vous n’avez pas besoin d’une correspondance textuelle.
- Activé par défaut : Non
- Échelle : 0,0-1,0
- Seuil par défaut : 0,5
-
Champs obligatoires :
prompt,expected_response - Vérité de terrain requise : Oui
Le score varie de 0,0 (pas de chevauchement) à 1,0 (correspondance complète).
Exemple de jeu de données PartialMatch
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Who is the CEO of Contoso?",
"expected_response": "The CEO of Contoso is Jane Smith.",
"evaluators": {
"PartialMatch": {}
}
}
]
}
ExactMatch
L’évaluateur ExactMatch effectue une comparaison directe de chaînes entre la réponse de l’agent et le fichier .expected_response Elle renvoie une valeur booléenne de réussite ou d’échec : soit la réponse correspond exactement, soit elle ne correspond pas. Cet évaluateur est utile pour les invites avec des réponses attendues déterministes ou formules.
- Activé par défaut : Non
- Mettre à l’échelle : Booléen (réussite ou échec)
- Seuil par défaut : Non applicable
-
Champs obligatoires :
prompt,expected_response - Vérité de terrain requise : Oui
Options de configuration d’ExactMatch
| Option | Type | Requis | Description |
|---|---|---|---|
case_sensitive |
boolean | Non | Contrôle si la comparaison respecte la casse. La valeur par défaut est true. |
Exemple de jeu de données ExactMatch
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "What is 2 + 2?",
"expected_response": "4",
"evaluators": {
"ExactMatch": { "case_sensitive": false }
}
}
]
}