Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Use evaluaciones en la nube para probar aplicaciones de IA generativas a escala sin administrar el proceso local. Este artículo configura el cliente del SDK compartido y le ayuda a elegir un flujo de trabajo para la evaluación previa a la implementación o producción.
Prerequisites
Una implementación de Azure OpenAI con un modelo GPT que admita la finalización de chat, como
gpt-5-mini.El rol Usuario de Foundry en el proyecto Foundry.
Importante
Recientemente se cambió el nombre de los roles RBAC de Foundry. Foundry User, Foundry Owner, Foundry Account Owner y Foundry Project Manager se llamaban anteriormente Usuario de Azure AI, Propietario de Azure AI, Propietario de la cuenta de Azure AI y Administrador de proyectos de Azure AI. Es posible que siga viendo los nombres anteriores en algunos lugares mientras se implementa el cambio de nombre. El cambio de nombre no modifica los identificadores de rol y los permisos principales.
Opcionalmente, su propia cuenta de almacenamiento para los datos de evaluación.
Algunas características de evaluación tienen restricciones regionales. Revise las regiones admitidas antes de comenzar.
Configuración del cliente del SDK
Instale el SDK para el idioma. Establezca estas variables de entorno compartidas:
-
AZURE_AI_PROJECT_ENDPOINT: el punto de conexión del proyecto de Foundry, por ejemplo,https://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: la implementación del modelo que usan los evaluadores asistidos por IA. -
DATASET_NAMEyDATASET_VERSION: valores opcionales para conjuntos de datos reutilizables.
Autentíquese con DefaultAzureCredential, cree el cliente del proyecto y obtenga el cliente de OpenAI que usa la API de evaluación.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Referencia: AIProjectClient, DefaultAzureCredential
Para usar un modelo conectado a través de conexiones de administrador como destino, modelo de juez o simulador de conversación, consulte Uso de modelos conectados al administrador en evaluaciones en la nube.
Descripción del flujo de trabajo de evaluación
Una evaluación de la nube tiene tres pasos:
- Defina la estructura de datos y los evaluadores que la evalúan.
- Cree la evaluación con el cliente de evaluación.
- Inicie una ejecución, sondee hasta que finalice y recupere los resultados puntuados.
Los resultados de la evaluación en la nube se almacenan en el proyecto foundry. Puede recuperarlos a través del SDK, revisarlos en el portal o enrutarlos a Application Insights cuando esté conectado.
Elegir evaluadores
Los evaluadores se vinculan a los campos de sus datos mediante el mapeo de columnas. Los flujos de trabajo de conjuntos de datos exponen los campos de los elementos, mientras que los flujos de trabajo generados por el destino también exponen la salida del modelo o del agente a través del esquema de muestra.
Revise los evaluadores integrados y los evaluadores personalizados antes de configurar los criterios de prueba.
Elija el punto de partida.
| Unidad de evaluación | Punto de partida | Workflow |
|---|---|---|
| Turno individual | Tienes datos de prueba JSONL o CSV con una consulta y una respuesta. | Evaluación de conjuntos de datos de consulta-respuesta |
| Turno individual | Tiene consultas y desea que un modelo o agente genere respuestas. | Evaluación de respuestas de modelo y agente |
| Turno individual | Ha almacenado respuestas o trazas de interacciones individuales con un modelo o agente desplegado. | Evaluación de las interacciones de agente y modelo implementadas |
| Turno individual | Debe generar consultas sintéticas. | Generación de consultas sintéticas |
| Conversación completa | Dispone de un conjunto de datos de conversaciones completas. | Evaluación de conjuntos de datos de conversación |
| Conversación completa | Tiene seguimientos que capturan conversaciones completas con un modelo o agente implementados. | Evaluar el modelo implementado y las conversaciones del agente |
| Conversación completa | Necesita generar y evaluar conversaciones simuladas de agentes. | Simular conversaciones de agente |
| Cualquier unidad de evaluación | Necesita sondear, interpretar, cancelar o solucionar problemas de una ejecución. | Obtención de resultados de evaluación |
Para pruebas de seguridad adversarias, utilice AI red teaming. Para crear un conjunto de datos independiente, consulte Generación de un conjunto de datos de evaluación sintética.