Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
La CLI de evaluaciones de agentes de Microsoft 365 Copilot (@microsoft/m365-copilot-eval) le ayuda a probar, medir y mejorar la calidad de sus agentes con evaluaciones estructuradas e informes de resultados enriquecidos con puntuación basada en IA.
Importante
Para los agentes declarativos implementados, comience con Work IQ Dev Tools (versión preliminar) para obtener un flujo de trabajo guiado. Work IQ Dev Tools administra la versión de la CLI de evaluaciones de agentes compatible y la expone a través de wiqd agent eval. Use la guía independiente de la CLI de esta sección cuando necesite control de comandos de nivel inferior o mantenga un flujo de trabajo existente runevals .
Qué puede hacer
La herramienta de evaluación proporciona las siguientes funcionalidades:
- Ejecutar evaluaciones por lotes e interactivas.
- Califique automáticamente las respuestas mediante la evaluación en la nube y las métricas integradas de Microsoft Foundry.
- Pruebe con conjuntos de datos JSON, mensajes en línea o entradas interactivas.
- Generar informes en formatos HTML, JSON o CSV.
Métricas de evaluación
Cada respuesta se califica utilizando métricas de evaluación estándar.
| Evaluador | Tipo | Escalar | Umbral predeterminado | Predeterminado |
|---|---|---|---|---|
| Relevancia | Basado en LLM | 1-5 | 3 | Sí |
| Coherencia | Basado en LLM | 1-5 | 3 | Sí |
| Conexión a tierra | Basado en LLM | 1-5 | 3 | No |
| Similitud | Basado en LLM | 1-5 | 3 | No |
| RetrievalQuery | No LLM | Aprobado o suspenso | N/D | No |
| RetrievalResult | No LLM | Proporcional | 1.0 | No |
| Citas | Basado en recuentos | >= 0 | 1 | No |
| Coincidencia exacta | Coincidencia de cadena | booleano | N/D | No |
| Coincidencia parcial | Coincidencia de cadena | 0.0-1.0 | 0.5 | No |
Para obtener información detallada sobre cada evaluador, incluidas las opciones de configuración y los conjuntos de datos de muestra, consulte Referencia de evaluadores.
Cómo funciona el flujo de trabajo de evaluación
Las evaluaciones siguen un flujo de trabajo coherente:
- Instale y configure la CLI.
- Proporcione configuración y credenciales del entorno.
- Cree un conjunto de datos de solicitudes de prueba.
- Ejecutar evaluaciones en tu agente.
- Revise los resultados e itere.
Variables de entorno necesarias
La herramienta de evaluación usa variables de entorno para autenticar y conectarse a su inquilino y al proyecto de Microsoft Foundry.
| Variable | Descripción | Predeterminado |
|---|---|---|
TENANT_ID |
Id. del inquilino de Microsoft Entra donde se implementa el agente. | Ninguno |
AZURE_AI_PROJECT_ENDPOINT |
Punto de conexión del proyecto de Microsoft Foundry que se usa para la evaluación en la nube. | Ninguno |
AZURE_AI_MODEL_NAME |
Nombre de implementación del modelo en el proyecto de Microsoft Foundry. | gpt-5-mini |
M365_TITLE_ID (opcional) |
Id. de título que se usa para detectar automáticamente el id. de agente de Microsoft 365 para la evaluación. | Ninguno |
M365_AGENT_ID (opcional) |
Identificador de agente explícito para la evaluación. | Detectado automáticamente desde M365_TITLE_ID |
Estos valores habilitan la autenticación y permiten que la herramienta ejecute la puntuación de evaluación basada en LLM mediante Microsoft Foundry. Para obtener más información sobre cómo obtener estos valores, consulte Obtener valores para variables de entorno.