Evaluar un agente (versión preliminar)

[Este artículo es documentación preliminar y está sujeto a modificaciones].

La pestaña Evaluar en la nueva experiencia de agente ofrece pruebas estructuradas y repetibles para el agente. Utiliza evaluaciones para medir la calidad del agente en los casos de prueba, hacer seguimiento de las mejoras a lo largo del tiempo y validar el comportamiento de tu agente antes de publicarlo.

Important

  • Esta es una funcionalidad de previsualización preparada para producción.
  • Las versiones preliminares listas para producción están sujetas a condiciones de uso complementarias.

¿Qué es la evaluación del agente?

La evaluación de agentes le permite probar sistemáticamente las respuestas de su agente según los estándares de calidad. En lugar de probar cada escenario manualmente en la pestaña de Vista previa , crea evaluaciones con conversaciones de prueba, define cómo medir las respuestas y ejecuta las evaluaciones para obtener resultados cuantitativos.

La evaluación te ayuda a responder preguntas como estas:

  • ¿El agente responde correctamente en una variedad de escenarios esperados?
  • ¿Un cambio en la configuración mejoró o empeoró la calidad de la respuesta?
  • ¿El agente llama a las herramientas cuando debería?

Conceptos clave

Los siguientes conceptos son clave al realizar evaluaciones en Copilot Studio:

Conversaciones

Una conversación es un caso de prueba que representa un escenario que quiere que su agente maneje. Cada conversación incluye mensajes de usuario y, opcionalmente, respuestas esperadas del agente. Organice conversaciones en evaluaciones. Crea conversaciones manualmente, génalas con IA o súbelas desde un archivo CSV.

Evaluaciones

Una evaluación es un conjunto de pruebas con nombre que combina conversaciones con un método de prueba. Cree evaluaciones desde la pestaña Evaluar, agregue conversaciones y luego ejecútelas para producir resultados calificados.

Métodos de prueba

Los métodos de prueba determinan cómo se evalúan las respuestas del agente. Actualmente, el único método de prueba disponible es la calidad general, una evaluación basada en IA para determinar si las respuestas cumplen con los estándares de calidad, como la relevancia y la integridad.

Note

El método de prueba de Calidad general no compara las respuestas con las respuestas esperadas.

Perfil de usuario

Las evaluaciones se ejecutan bajo un perfil de usuario. Gestiona qué perfil autenticado ejecuta la evaluación para que las herramientas y conexiones del agente sean totalmente comprobables.

Flujo de trabajo de evaluación

Sigue estos pasos para evaluar a un agente:

  1. Crear una evaluación: En la pestaña Evaluar, inicie una nueva evaluación. Aprende más en Crear un conjunto de pruebas para un agente.
  2. Agregar conversaciones: Agregue conversaciones de prueba escribiéndolas manualmente, generándolas con IA o importando un archivo CSV.
  3. Configure: Asigne un nombre a la evaluación, seleccione el método de prueba, elija la versión del agente y establezca el perfil de usuario.
  4. Ejecuta la evaluación: Selecciona Evaluar para hacer la prueba y espera los resultados. Más información en Realizar una evaluación para un agente.
  5. Evaluar los resultados: Analice los puntajes e identifique oportunidades de mejora. Más información en Ver resultados de evaluación de un agente.
  6. Iterar: Ajusta las instrucciones, conocimientos o herramientas de tu agente, y luego ejecuta la evaluación de nuevo para medir el impacto.