Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
[Este artículo es documentación preliminar y está sujeto a modificaciones].
La pestaña Evaluar en la nueva experiencia de agente ofrece pruebas estructuradas y repetibles para el agente. Utiliza evaluaciones para medir la calidad del agente en los casos de prueba, hacer seguimiento de las mejoras a lo largo del tiempo y validar el comportamiento de tu agente antes de publicarlo.
Important
- Esta es una funcionalidad de previsualización preparada para producción.
- Las versiones preliminares listas para producción están sujetas a condiciones de uso complementarias.
¿Qué es la evaluación del agente?
La evaluación de agentes le permite probar sistemáticamente las respuestas de su agente según los estándares de calidad. En lugar de probar cada escenario manualmente en la pestaña de Vista previa , crea evaluaciones con conversaciones de prueba, define cómo medir las respuestas y ejecuta las evaluaciones para obtener resultados cuantitativos.
La evaluación te ayuda a responder preguntas como estas:
- ¿El agente responde correctamente en una variedad de escenarios esperados?
- ¿Un cambio en la configuración mejoró o empeoró la calidad de la respuesta?
- ¿El agente llama a las herramientas cuando debería?
Conceptos clave
Los siguientes conceptos son clave al realizar evaluaciones en Copilot Studio:
Conversaciones
Una conversación es un caso de prueba que representa un escenario que quiere que su agente maneje. Cada conversación incluye mensajes de usuario y, opcionalmente, respuestas esperadas del agente. Organice conversaciones en evaluaciones. Crea conversaciones manualmente, génalas con IA o súbelas desde un archivo CSV.
Evaluaciones
Una evaluación es un conjunto de pruebas con nombre que combina conversaciones con un método de prueba. Cree evaluaciones desde la pestaña Evaluar, agregue conversaciones y luego ejecútelas para producir resultados calificados.
Métodos de prueba
Los métodos de prueba determinan cómo se evalúan las respuestas del agente. Actualmente, el único método de prueba disponible es la calidad general, una evaluación basada en IA para determinar si las respuestas cumplen con los estándares de calidad, como la relevancia y la integridad.
Note
El método de prueba de Calidad general no compara las respuestas con las respuestas esperadas.
Perfil de usuario
Las evaluaciones se ejecutan bajo un perfil de usuario. Gestiona qué perfil autenticado ejecuta la evaluación para que las herramientas y conexiones del agente sean totalmente comprobables.
Flujo de trabajo de evaluación
Sigue estos pasos para evaluar a un agente:
- Crear una evaluación: En la pestaña Evaluar, inicie una nueva evaluación. Aprende más en Crear un conjunto de pruebas para un agente.
- Agregar conversaciones: Agregue conversaciones de prueba escribiéndolas manualmente, generándolas con IA o importando un archivo CSV.
- Configure: Asigne un nombre a la evaluación, seleccione el método de prueba, elija la versión del agente y establezca el perfil de usuario.
- Ejecuta la evaluación: Selecciona Evaluar para hacer la prueba y espera los resultados. Más información en Realizar una evaluación para un agente.
- Evaluar los resultados: Analice los puntajes e identifique oportunidades de mejora. Más información en Ver resultados de evaluación de un agente.
- Iterar: Ajusta las instrucciones, conocimientos o herramientas de tu agente, y luego ejecuta la evaluación de nuevo para medir el impacto.