Nota
L'accés a aquesta pàgina requereix autorització. Podeu provar d'iniciar la sessió o de canviar els directoris.
L'accés a aquesta pàgina requereix autorització. Podeu provar de canviar els directoris.
[Este artículo es documentación preliminar y está sujeto a cambios.]
La pestaña Evaluar en la nueva experiencia de agente ofrece pruebas estructuradas y repetibles para el agente. Utiliza evaluaciones para medir la calidad del agente en los casos de prueba, hacer seguimiento de las mejoras a lo largo del tiempo y validar el comportamiento de tu agente antes de publicarlo.
Importante
- Esta es una funcionalidad de previsualización preparada para producción.
- Las versiones preliminares listas para producción están sujetas a condiciones de uso complementarias.
¿Qué es la evaluación del agente?
La evaluación de agentes le permite probar sistemáticamente las respuestas de su agente según los estándares de calidad. En lugar de probar cada escenario manualmente en la pestaña de Vista previa , crea evaluaciones con conversaciones de prueba, define cómo medir las respuestas y ejecuta las evaluaciones para obtener resultados cuantitativos.
La evaluación te ayuda a responder preguntas como estas:
- ¿El agente responde correctamente en una variedad de escenarios esperados?
- ¿Un cambio en la configuración mejoró o empeoró la calidad de la respuesta?
- ¿El agente llama a las herramientas cuando debería?
Conceptos clave
Los siguientes conceptos son clave al realizar evaluaciones en Copilot Studio:
Conversaciones
Una conversación es un caso de prueba que representa un escenario que quiere que su agente gestione. Cada conversación incluye mensajes de usuario y, opcionalmente, respuestas esperadas del agente. Organizar conversaciones en evaluaciones. Crea conversaciones manualmente, génalas con IA o súbelas desde un archivo CSV.
Evaluations
Una evaluación es un conjunto de pruebas con nombre que combina conversaciones con un método de prueba. Cree evaluaciones desde la pestaña Evaluar, agregue conversaciones y luego ejecútelas para producir resultados calificados.
Métodos de prueba
Los métodos de prueba determinan cómo se evalúan las respuestas del agente. Actualmente, el único método de prueba disponible es la calidad general, una evaluación basada en IA para determinar si las respuestas cumplen con los estándares de calidad, como la relevancia y la integridad.
Note
El método de prueba de Calidad general no compara las respuestas con las respuestas esperadas.
Perfil de usuario
Las evaluaciones se realizan con el perfil de usuario iniciado sesión. Para usar un perfil de usuario diferente, cierra sesión y luego inicia sesión con la cuenta de ese perfil antes de empezar una evaluación.
Uso del crédito
La evaluación muestra el uso estimado de créditos de Copilot durante todo el proceso de pruebas, para que puedas comprender el coste de las pruebas de calidad antes de ejecutar conjuntos de pruebas más grandes. Puedes ver qué experiencias utilizan créditos, un total estimado para cada ejecución de evaluación, un desglose entre la generación y la puntuación de respuestas, y el uso de créditos a nivel de cada caso de prueba. Más información en Entender el uso estimado de crédito.
Flujo de trabajo de evaluación
Sigue estos pasos para evaluar a un agente:
- Crear una evaluación: En la pestaña Evaluar, inicie una nueva evaluación. Aprende más en Crear un conjunto de pruebas para un agente.
- Agregar conversaciones: Agregue conversaciones de prueba escribiéndolas manualmente, generándolas con IA o importando un archivo CSV.
- Configurar: Nombra la evaluación, selecciona un método de prueba y elige la versión del agente.
- Ejecuta la evaluación: Selecciona Evaluar para hacer la prueba y espera los resultados. Más información en Realizar una evaluación para un agente.
- Evaluar los resultados: Analice los puntajes e identifique oportunidades de mejora. Más información en Ver resultados de evaluación de un agente.
- Iterar: Ajusta las instrucciones, conocimientos o herramientas de tu agente, y luego ejecuta la evaluación de nuevo para medir el impacto.
Limitations
Las evaluaciones solo admiten agentes configurados para usar Sin autenticación o Autenticarse con Microsoft. No se soportan los agentes configurados para Autenticar manualmente.