Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
La CLI de evaluaciones del agente de Microsoft 365 Copilot incluye un conjunto de evaluadores que puntúan automáticamente las respuestas del agente. Cada evaluador mide un aspecto diferente de la calidad, desde la relevancia semántica hasta la coincidencia exacta de cadenas. Este artículo describe cada evaluador, su comportamiento de puntuación, opciones de configuración y cómo usarlo en los conjuntos de datos de prueba.
Para obtener información sobre cómo configurar evaluadores en los conjuntos de datos, consulte Configuración de evaluadores.
Puede encontrar el esquema del conjunto de datos de evaluación en formato de esquema JSON en GitHub.
Resumen del evaluador
En la tabla siguiente se resumen todos los evaluadores disponibles.
| Evaluador | Tipo | Escalar | Umbral predeterminado | Habilitado de forma predeterminada | Campos obligatorios |
|---|---|---|---|---|---|
| Relevancia | Basado en LLM | 1-5 | 3 | Sí | prompt |
| Coherencia | Basado en LLM | 1-5 | 3 | Sí | prompt |
| Conexión a tierra | Basado en LLM | 1-5 | 3 | No | prompt |
| Similitud | Basado en LLM | 1-5 | 3 | No |
prompt, expected_response |
| RetrievalQuery | No LLM | Aprobado o suspenso | N/D | No |
prompt, Configuración del evaluador |
| RetrievalResult | No LLM | Proporcional | 1.0 | No |
prompt, Configuración del evaluador |
| Citas | Basado en recuentos | >= 0 | 1 | No | prompt |
| Coincidencia parcial | Coincidencia de cadena | 0.0-1.0 | 0.5 | No |
prompt, expected_response |
| Coincidencia exacta | Coincidencia de cadena | Booleano | N/D | No |
prompt, expected_response |
Evaluadores basados en LLM
Los evaluadores basados en LLM usan un modelo de Azure OpenAI en el proyecto de Microsoft Foundry (configurado mediante las variables de entorno) para juzgar la calidad de la respuesta del agente. Estos evaluadores cuentan con la tecnología del SDK de evaluación de IA de Azure. Las puntuaciones van del 1 al 5 en una escala Likert, donde los valores más altos indican una mejor calidad. De forma predeterminada, se requiere una puntuación de 3 o más para aprobar. Puede cambiar la puntuación requerida en la configuración de la prueba.
Relevancia
El evaluador de relevancia evalúa qué tan bien la respuesta del agente aborda la consulta del usuario. Evalúa si la respuesta responde directa y completamente a la pregunta formulada.
- Habilitado de manera predeterminada: Sí
- Escala: 1-5 (Likert)
- Umbral predeterminado: 3
-
Campos obligatorios:
prompt - Se requiere verdad sobre el terreno: No
El evaluador de relevancia no necesita una expected_response , solo evalúa la relación entre la consulta y la respuesta.
Conjunto de datos de ejemplo de relevancia
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Relevance": {}
},
"items": [
{
"prompt": "What are the key features of our enterprise plan?",
"expected_response": "The enterprise plan includes advanced security, unlimited storage, 24/7 support, and custom integrations."
}
]
}
Coherencia
El evaluador de coherencia mide la presentación lógica y ordenada de ideas en la respuesta del agente. Evalúa si la respuesta tiene conexiones claras entre oraciones, transiciones apropiadas y una secuencia lógica de ideas que sea fácil de seguir.
- Habilitado de manera predeterminada: Sí
- Escala: 1-5 (Likert)
- Umbral predeterminado: 3
-
Campos obligatorios:
prompt - Se requiere verdad sobre el terreno: No
Conjunto de datos de ejemplo de coherencia
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Coherence": {}
},
"items": [
{
"prompt": "Explain the process for submitting an expense report.",
"expected_response": "To submit an expense report, first collect your receipts. Then open the expense portal, create a new report, attach your receipts, and submit for manager approval."
}
]
}
Conexión a tierra
El evaluador de fundamentación comprueba si la respuesta del agente es coherente y está respaldada por el contexto de fundamentación proporcionado. Se centra en la precisión al verificar que la respuesta no contiene notificaciones o información que vayan más allá de lo que admiten los documentos recuperados.
- Habilitado de manera predeterminada: No
- Escala: 1-5 (Likert)
- Umbral predeterminado: 3
-
Campos obligatorios:
prompt,expected_response - Se requiere verdad sobre el terreno: No
Utilice el evaluador de Groundedness para detectar alucinaciones o afirmaciones sin fundamento en las respuestas de su agente.
Conjunto de datos de ejemplo de conexión a tierra
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Relevance": {},
"Groundedness": {}
},
"items": [
{
"prompt": "What is our company's remote work policy?",
"expected_response": "Employees can work remotely up to 3 days per week with manager approval."
}
]
}
Similitud
El evaluador de similitud mide el grado de similitud semántica entre la respuesta del agente y una (verdad fundamental) proporcionada expected_response . A diferencia de las métricas de superposición de tokens, como F1 o Bilingual Evaluation Understudy (BLEU), se centra en el significado y el contexto más amplio en lugar de las coincidencias de palabras a nivel superficial.
- Habilitado de manera predeterminada: No
- Escala: 1-5 (Likert)
- Umbral predeterminado: 3
-
Campos obligatorios:
prompt,expected_response - Se requiere verdad sobre el terreno: Sí
Debe configurar expected_response en el conjunto de datos elementos para el evaluador de similitud.
Conjunto de datos de ejemplo de similitud
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Similarity": {}
},
"items": [
{
"prompt": "What is Microsoft Graph?",
"expected_response": "Microsoft Graph is a unified API endpoint that provides access to data and intelligence in Microsoft 365 services."
}
]
}
Evaluadores de recuperación
Los evaluadores de recuperación validan la canalización de recuperación de un extremo a otro del agente de Microsoft 365 Copilot. Inspeccionan cómo el agente traduce las consultas de usuario en operaciones de recuperación y si los recursos esperados aparecen en los resultados. Estos evaluadores no usan un juez LLM: realizan comprobaciones deterministas de los datos de ejecución de recuperación.
RetrievalQuery
El evaluador de RetrievalQuery valida que Copilot ha traducido correctamente la intención del usuario en consultas de recuperación. Inspecciona los queryString valores dentro del normalizado retrieval_executions[] y comprueba que coincidan con los patrones esperados.
- Habilitado de manera predeterminada: No
- Escala: Aprobado o suspenso
- Umbral predeterminado: No disponible
-
Campos obligatorios:
prompt, configuración del evaluador - Se requiere verdad sobre el terreno: No
Opciones de configuración de RetrievalQuery
| Opción | Tipo | Obligatorio | Descripción |
|---|---|---|---|
capability |
string | Sí | La capacidad de recuperación para determinar qué ejecuciones se examinan (por ejemplo, "OneDriveAndSharePoint", "Email", "GraphConnectors"). |
selector |
string | Sí | Subcadena que no distingue mayúsculas de minúsculas y que se usa para identificar la consulta de destino dentro de las ejecuciones de recuperación. |
includes |
string | Sí | Subcadenas que DEBEN aparecer en la consulta coincidente. |
excludes |
string | Sí | Subcadenas que NO DEBEN aparecer en la consulta coincidente. |
Conjunto de datos de ejemplo RetrievalQuery
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Find the Q4 sales report in SharePoint",
"expected_response": "Here is the Q4 sales report.",
"evaluators": {
"RetrievalQuery": {
"capability": "OneDriveAndSharePoint",
"selector": "Q4 sales report",
"includes": ["projections", "profit"],
"excludes": ["FileType:OneNote"]
}
}
}
]
}
RetrievalResult
El evaluador RetrievalResult valida que los recursos esperados aparecen realmente en los documentos, mensajes y elementos que devuelven las ejecuciones de recuperación. Comprueba si hay fragmentos de texto específicos presentes en las extracciones de aciertos de recuperación dentro de un umbral de clasificación configurable.
- Habilitado de manera predeterminada: No
- Escala: Proporcional (0,0-1,0)
- Umbral predeterminado: 1,0 (todas las comprobaciones deben pasar)
-
Campos obligatorios:
prompt, configuración del evaluador - Se requiere verdad sobre el terreno: No
La puntuación es proporcional al número de elementos esperados encontrados. Por ejemplo, si se encuentran 2 de los 3 elementos esperados, la puntuación es 0,67. Sin embargo, una aprobación requiere todas las comprobaciones para tener éxito (el umbral siempre es 1.0). Debe configurar al menos uno de los métodos o expected_itemsmin_expected_count.
Opciones de configuración de RetrievalResult
| Opción | Tipo | Obligatorio | Descripción |
|---|---|---|---|
expected_items |
matriz | Condicional | Matriz de objetos que especifican los resultados esperados. Cada objeto puede incluir retrievalExtract_contains (un fragmento de texto para que coincida en las extracciones de los hits de recuperación). Debe configurar al menos uno de los métodos o expected_itemsmin_expected_count. |
expected_items[].retrievalExtract_contains |
string | No | Un fragmento de texto que debe aparecer en un extracto de hit de recuperación. |
min_expected_count |
integer | Condicional | Número mínimo de resultados que se deben recuperar. Debe configurar al menos uno de los métodos o expected_itemsmin_expected_count. |
max_rank |
integer | No | Posición de rango máximo a tener en cuenta al emparejar los elementos esperados. Valores predeterminados de 10. |
Conjunto de datos de ejemplo RetrievalResult
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Find recent emails about the Contoso project",
"expected_response": "Here are the recent emails about the Contoso project.",
"evaluators": {
"RetrievalResult": {
"expected_items": [
{ "retrievalExtract_contains": "update" },
{ "retrievalExtract_contains": "budget" }
],
"max_rank": 5,
"min_expected_count": 2
}
}
}
]
}
Evaluadores basados en cadenas y recuentos
Estos evaluadores usan una lógica determinista de coincidencia o recuento de cadenas. No requieren un LLM y se ejecutan localmente.
Citas
El evaluador de citas cuenta el número de referencias de citas en la respuesta del agente, como [1], [2], o citas de estilo hipervínculo. Comprueba que el agente atribuye correctamente sus afirmaciones a las fuentes. Establezca el umbral en el número esperado de citas.
- Habilitado de manera predeterminada: No
- Escala:>= 0 (recuento)
- Umbral predeterminado: 1
-
Campos obligatorios:
prompt - Se requiere verdad sobre el terreno: No
La puntuación es igual al número de citas, y se requiere un mínimo de 1 cita para aprobarse de forma predeterminada.
Opciones de configuración de citas
| Opción | Tipo | Obligatorio | Descripción |
|---|---|---|---|
citation_format |
string | No | Especifica el formato de cita esperado, como "mixed". |
Conjunto de datos de ejemplo de citas
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "What is our return policy?",
"expected_response": "Our return policy allows returns within 30 days [1].",
"evaluators": {
"Citations": {
"threshold": 2,
"citation_format": "mixed"
}
}
}
]
}
Coincidencia parcial
El evaluador PartialMatch mide el grado de superposición textual entre la respuesta del agente y el expected_response uso de similitud a nivel de token (análogo a un enfoque de puntuación F1). Este evaluador es útil cuando se espera que la respuesta contenga frases clave o información de la respuesta esperada, pero no se necesita una coincidencia literal.
- Habilitado de manera predeterminada: No
- Escala: 0.0-1.0
- Umbral predeterminado: 0,5
-
Campos obligatorios:
prompt,expected_response - Se requiere verdad sobre el terreno: Sí
La puntuación oscila entre 0,0 (sin superposición) y 1,0 (coincidencia completa).
Conjunto de datos de ejemplo de PartialMatch
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Who is the CEO of Contoso?",
"expected_response": "The CEO of Contoso is Jane Smith.",
"evaluators": {
"PartialMatch": {}
}
}
]
}
Coincidencia exacta
El evaluador de ExactMatch realiza una comparación de cadenas directa entre la respuesta del agente y el expected_responsearchivo . Devuelve un valor booleano de aprobado o error: la respuesta coincide exactamente o no. Este evaluador es útil para indicaciones con respuestas esperadas deterministas o formuladas.
- Habilitado de manera predeterminada: No
- Escala: Booleano (aprobado o suspenso)
- Umbral predeterminado: No disponible
-
Campos obligatorios:
prompt,expected_response - Se requiere verdad sobre el terreno: Sí
Opciones de configuración de ExactMatch
| Opción | Tipo | Obligatorio | Descripción |
|---|---|---|---|
case_sensitive |
boolean | No | Controla si la comparación distingue mayúsculas de minúsculas. Valores predeterminados de true. |
Conjunto de datos de muestra de ExactMatch
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "What is 2 + 2?",
"expected_response": "4",
"evaluators": {
"ExactMatch": { "case_sensitive": false }
}
}
]
}