Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Use evaluaciones en la nube para probar aplicaciones de IA generativas a escala sin administrar el proceso local. Este artículo configura el cliente del SDK compartido y le ayuda a elegir un flujo de trabajo para la evaluación previa a la implementación o producción.
Prerequisites
Una implementación de OpenAI Azure con un modelo GPT que admita la finalización del chat, como
gpt-5-mini.Rol De usuario de Foundry en el proyecto Foundry.
Importante
Recientemente se cambió el nombre de los roles RBAC de Foundry. Foundry User, Foundry Owner, Foundry Account Owner y Foundry Project Manager se llamaban anteriormente Usuario de Azure AI, Propietario de Azure AI, Propietario de la cuenta de Azure AI y Administrador de proyectos de Azure AI. Es posible que siga viendo los nombres anteriores en algunos lugares mientras se implementa el cambio de nombre. El cambio de nombre no modifica los identificadores de rol y los permisos principales.
Opcionalmente, su propia cuenta de almacenamiento para los datos de evaluación.
Algunas características de evaluación tienen restricciones regionales. Revise las regiones admitidas antes de comenzar.
Configuración del cliente del SDK
Instale el SDK para el idioma. Establezca estas variables de entorno compartidas:
-
AZURE_AI_PROJECT_ENDPOINT: el punto de conexión del proyecto de Foundry, por ejemplo,https://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: la implementación del modelo que usan los evaluadores asistidos por IA. -
DATASET_NAMEyDATASET_VERSION: valores opcionales para conjuntos de datos reutilizables.
Autentíquese con DefaultAzureCredential, cree el cliente del proyecto y obtenga el cliente de OpenAI que usa la API de evaluación.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Para usar un modelo conectado a través de conexiones de administrador como destino, modelo de juez o simulador de conversación, consulte Uso de modelos conectados al administrador en evaluaciones en la nube.
Descripción del flujo de trabajo de evaluación
Una evaluación de la nube tiene tres pasos:
- Defina la estructura de datos y los evaluadores que la evalúan.
- Cree la evaluación con
openai_client.evals.create(). - Inicie una ejecución con
openai_client.evals.runs.create(), sondee hasta que finalice y recupere los resultados puntuados.
Los resultados de la evaluación en la nube se almacenan en el proyecto foundry. Puede recuperarlos a través del SDK, revisarlos en el portal o enrutarlos a Application Insights cuando esté conectado.
Elegir evaluadores
Los evaluadores se vinculan a los campos de sus datos mediante el mapeo de columnas. Los flujos de trabajo del conjunto de datos exponen campos de elementos, mientras que los flujos de trabajo generados por destino también exponen la salida del modelo o del agente a través del esquema de ejemplo.
Revise los evaluadores integrados y los evaluadores personalizados antes de configurar los criterios de prueba.
Elija el punto de partida.
| Punto de partida | Workflow |
|---|---|
| Tiene datos de prueba en formato JSONL o CSV con una consulta y una respuesta. | Evaluación de conjuntos de datos en la nube |
| Tiene consultas y desea que un modelo o agente genere respuestas. | Evaluación de modelos y agentes en la nube |
| Ha implementado un modelo o agente con trazas de Application Insights. | Evaluación de las interacciones del agente y del modelo implementados |
| Dispone de datos de conversaciones completas o de trazas de conversaciones en producción. | Evaluación de conversaciones en la nube |
| Necesita consultas sintéticas o conversaciones simuladas. | Generación de datos sintéticos |
| Necesita sondear, interpretar, cancelar o solucionar problemas en una ejecución. | Obtención de resultados de evaluación en la nube |
Para las pruebas adversarias de seguridad, utilice red teaming de IA. Para crear un conjunto de datos independiente, consulte Generación de un conjunto de datos de evaluación sintética.