Inicio rápido: Evaluación del agente hospedado

Note

La experiencia de evaluación de la CLI para desarrolladores de Azure está actualmente en versión preliminar.

En este inicio rápido, evaluará el agente hospedado que implementó en Implementación del primer agente hospedado. Proporcione un conjunto de datos de prueba, elija evaluadores, ejecute una evaluación en el agente implementado y revise las puntuaciones. Cada paso muestra cinco maneras de realizar la misma tarea: la CLI para desarrolladores de Azure (azd), el portal de Microsoft Foundry, el SDK de Python, el SDK de C# y el SDK de JavaScript/TypeScript.

La evaluación establece una línea base de calidad para el agente y le permite establecer umbrales de aceptación, como una tasa de superación de cumplimiento de tareas, antes de liberar los cambios en los usuarios.

Prerequisites

Antes de comenzar, necesita lo siguiente:

  • Un agente hospedado implementado e invocable desde Deploy your first hosted agent (Implementar el primer agente hospedado). Si sigue la ruta de Azure Developer CLI, también necesitará el directorio del proyecto azd que creó en esa guía de inicio rápido.

  • El rol Usuario de Foundry en el recurso Foundry.

  • Una implementación de modelo de finalización de chat en el mismo proyecto de Foundry que se usará como modelo de evaluación para calificar las respuestas. Puede reutilizar la implementación del modelo que el agente ya usa, incluida la del inicio rápido anterior, por lo que no necesita una implementación independiente.

    Importante

    Recientemente se cambió el nombre de los roles RBAC de Foundry. Foundry User, Foundry Owner, Foundry Account Owner y Foundry Project Manager se llamaban anteriormente Usuario de Azure AI, Propietario de Azure AI, Propietario de la cuenta de Azure AI y Administrador de proyectos de Azure AI. Es posible que siga viendo los nombres anteriores en algunos lugares mientras se implementa el cambio de nombre. El cambio de nombre no modifica los identificadores de rol y los permisos principales.

Cada paso ofrece cinco rutas de acceso. Use lo que prefiera:

  • Azure CLI para desarrolladores: la azd ai agent extensión (azure.ai.agents), versión 0.1.40-preview o posterior, que proporciona los azd ai agent eval comandos. Esta extensión se incluye en la microsoft.foundry extensión que instaló en el inicio rápido anterior. Compruebe la versión instalada con azd ext listy ejecute azd ext upgrade microsoft.foundry si es necesario. Inicie sesión con azd auth login.
  • Portal de Foundry: acceso al portal de Foundry.
  • Python SDK: Python 3.10 o posterior, y el CLI de Azure inició sesión con az login para que DefaultAzureCredential pueda autenticarse. Para la instalación, consulte Instalación de la CLI de Azure.
  • SDK de C#: .NET 10 SDK o posterior, y el CLI de Azure inició sesión con az login para que DefaultAzureCredential pueda autenticarse.
  • SDK de JavaScript/TypeScript: Node.js 20 LTS o posterior, y el CLI de Azure inició sesión con az login para que DefaultAzureCredential pueda autenticarse.

Paso 1: Confirme su agente desplegado

La evaluación se realiza sobre un agente invocable desplegado. Asegúrese de que el agente esté desplegado y disponible antes de configurar la evaluación.

En el azd directorio del proyecto, compruebe que el agente está implementado e invocable:

azd ai agent show

Enviar un prompt de prueba:

azd ai agent invoke "Write a haiku about deploying cloud applications."

Debería ver una respuesta en unos segundos.

Paso 2: Configurar evaluadores integrados

Empiece con evaluadores integrados para evaluar su agente con un conjunto de datos de prueba.

En primer lugar, cree un archivo JSONL de consultas de prueba para el agente. Cada línea es un objeto JSON con un query campo. Guárdelo dentro de la carpeta fuente del agente, con el nombre src/<your-agent-name>/tests/queries.jsonl:

{"query": "Write a haiku about deploying cloud applications."}

A continuación, cree un eval.yaml archivo en la misma carpeta de origen del agente, que src/<your-agent-name>/eval.yaml. Apunta al conjunto de datos y enumera los evaluadores integrados que se van a aplicar. La dataset.local_uri ruta es relativa a esta carpeta. Reemplace <your-agent-name> por el nombre de su agente alojado y <your-chat-completion-deployment> por la implementación del modelo de juez:

name: agent-eval
agent:
  name: <your-agent-name>
  kind: hosted
dataset:
  local_uri: tests/queries.jsonl
evaluators:
  - builtin.intent_resolution
  - builtin.task_adherence
options:
  eval_model: <your-chat-completion-deployment>
max_samples: 15

El valor de eval_model es el modelo evaluador que puntúa las respuestas; puede reutilizar el despliegue que ya usa su agente.

Paso 3: Ejecución de la evaluación

Ejecute la batería de pruebas con su agente implementado. El servicio envía cada consulta de prueba al agente, captura la respuesta y la puntúa con los evaluadores seleccionados.

Note

La evaluación basada en destino invoca directamente al agente hospedado. Funciona con agentes que usan el protocolo de respuestas o invocaciones con ejecución sincrónica y sin streaming. Para evaluar agentes que usan el protocolo A2A o Activity, u otros patrones de ejecución como los de larga duración o en flujo, evalúe en su lugar las trazas que emite el agente. Consulte Evaluación de seguimiento.

Ejecute la evaluación desde la raíz del área de trabajo azd:

azd ai agent eval run --config eval.yaml

Note

azd ai agent eval run resuelve la ruta de acceso relativa a la --config carpeta de origen del agente en src/ (por ejemplo, src/<your-agent-name>/eval.yaml), no al directorio actual. Mantenga eval.yamly el conjunto de datos al que apunta local_uri , dentro de esa carpeta.

El comando lee eval.yaml, envía cada consulta al agente, puntúa las respuestas e imprime un resumen cuando finaliza:

Eval run started
   Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
   Run:  evalrun_5f72ef189ad24790a32128e6f230b131
   (✓) Done  Eval run

Results:    1 total, 1 passed, 0 failed, 0 errored

Per-criteria results:
  intent_resolution: 1 passed, 0 failed, 0 errored
  task_adherence: 1 passed, 0 failed, 0 errored

Paso 4: Revisar los resultados

Las evaluaciones normalmente se completan en unos minutos, en función del número de consultas.

Enumerar las evaluaciones recientes:

azd ai agent eval list
    Eval ID                                Name        Status of last run  Runs
    -------                                ----        ------------------  ----
*   eval_b36748dede424e4ba3f8e6c99ca2cf27  agent-eval  Completed           1

* = active eval in current environment

Muestra la evaluación más reciente y sus ejecuciones:

azd ai agent eval show
Eval:   eval_b36748dede424e4ba3f8e6c99ca2cf27
Name:   agent-eval
Agent:  <your-agent-name>
Runs:   1

Recent runs:
  Run ID                                    Status     Passed  Failed  Created
  ------                                    ------     ------  ------  -------
  evalrun_5f72ef189ad24790a32128e6f230b131  Completed  1/1     0       2026-06-17 14:52 UTC

Utilice los resultados para confirmar qué versión del agente se evaluó y qué puntuaciones de evaluación se generaron. Para ver los detalles por evaluador y un vínculo al informe en el portal de Foundry, ejecute azd ai agent eval show <eval-id> --eval-run-id <run-id>.

Limpieza de recursos

En este inicio rápido se registra un conjunto de datos, una evaluación y un historial de ejecución en el proyecto Foundry. Estos recursos conllevan poco o ningún costo continuo.

Para quitar el agente hospedado y los recursos de Azure creados, siga los pasos de limpieza de Implementación del primer agente hospedado.

Troubleshooting

Issue Solución
Comando azd ai agent eval no encontrado Ejecute azd ext list y compruebe que la azd ai agent extensión es 0.1.40-versión preliminar o posterior. Actualice con azd ext upgrade microsoft.foundry.
azd ai agent eval run no encuentra el agente Confirme que el agente está implementado e invocable con azd ai agent show. Vuelva a implementar con azd deploy si es necesario.
ModuleNotFoundError para azure.ai.projects o azure.identity Instale el SDK: pip install "azure-ai-projects>=2.0.0" azure-identity.
C#: The type or namespace name 'Evals' (or 'AIProjectClient') could not be found Agregue los paquetes: dotnet add package Azure.AI.Projects --prerelease, dotnet add package OpenAIy dotnet add package Azure.Identity.
AuthenticationError, DefaultAzureCredential o Forbidden fallo Inicie sesión con az login (o azd auth login vía CLI) y confirme que tiene el rol Usuario de Foundry en el proyecto. Las cargas de conjuntos de datos también requieren acceso de escritura al almacenamiento del proyecto.
No se encontró el destino del agente Compruebe el nombre del agente y la versión con project_client.agents.get("<your-agent-name>") o project_client.agents.list().
Muchas filas con errores o puntuaciones inesperadamente bajas Abra la URL del informe y compruebe si alguna fila falló por errores en la respuesta del agente o del evaluador. Corrija los errores subyacentes y vuelva a ejecutar la evaluación.
No se encontró la implementación del modelo de evaluación Compruebe que la implementación del modelo evaluador (FOUNDRY_MODEL_NAME para el SDK o eval_model en eval.yaml) existe en su proyecto, en Build>Deployments.

Lo que ha aprendido

En esta guía de inicio rápido:

  • Creó un conjunto de datos de prueba y eligió evaluadores para el agente hospedado.
  • Se ejecutó una evaluación contra el agente implementado.
  • Se revisaron los resultados agregados y de nivel de fila.
  • Completó cada tarea con la CLI para desarrolladores de Azure, el portal de Foundry, el SDK de Python, el SDK de C# o el SDK de JavaScript/TypeScript.

Pasos siguientes

Continúe mejorando el flujo de trabajo de evaluación: