Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Use avaliações de nuvem para testar aplicativos de IA generativos em escala sem gerenciar a computação local. Este artigo configura o cliente SDK compartilhado e ajuda você a escolher um fluxo de trabalho para pré-implantação ou avaliação de produção.
Pré-requisitos
Uma implantação Azure OpenAI com um modelo GPT que dá suporte à conclusão do chat, como
gpt-5-mini.A função Usuário do Foundry no projeto Foundry.
Importante
As funções RBAC do Foundry foram renomeadas recentemente. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager eram anteriormente chamados de Usuário do Azure AI, Proprietário do Azure AI, Proprietário da conta do Azure AI e Gerente de Projeto do Azure AI. Você ainda pode ver os nomes anteriores em alguns lugares enquanto essa mudança de nome está sendo implementada. Os IDs das funções e as permissões principais não são alterados com a mudança de nome.
Opcionalmente, sua própria conta de armazenamento para dados de avaliação.
Alguns recursos de avaliação têm restrições regionais. Examine as regiões com suporte antes de começar.
Configurar o cliente do SDK
Instale o SDK para seu idioma. Defina estas variáveis de ambiente compartilhado:
-
AZURE_AI_PROJECT_ENDPOINT: A URL de extremidade do seu projeto do Foundry, por exemplo,https://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: a implantação de modelo usada por avaliadores assistidos por IA. -
DATASET_NAMEeDATASET_VERSION: valores opcionais para conjuntos de dados reutilizáveis.
Autentique com DefaultAzureCredential, crie o cliente do projeto e obtenha o cliente OpenAI usado pela API de avaliação.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Para usar um modelo conectado por meio de conexões de administrador como um destino, modelo de juiz ou simulador de conversa, consulte Usar modelos conectados a administradores em avaliações de nuvem.
Entender o fluxo de trabalho de avaliação
Uma avaliação de nuvem tem três etapas:
- Defina a forma de dados e os avaliadores que a pontuam.
- Crie a avaliação com
openai_client.evals.create(). - Inicie uma execução com
openai_client.evals.runs.create(), sondar até que ela seja concluída e recuperar os resultados pontuados.
Os resultados da avaliação de nuvem são armazenados em seu projeto do Foundry. Você pode recuperá-los por meio do SDK, revisá-los no portal ou roteá-los para o Application Insights quando ele estiver conectado.
Escolher avaliadores
Os avaliadores se associam a campos em seus dados por meio de mapeamentos de coluna. Os fluxos de trabalho do conjunto de dados expõem os campos de item, enquanto os fluxos de trabalho gerados por destino também expõem a saída do modelo ou do agente por meio do esquema de exemplo.
Examine os avaliadores internos e os avaliadores personalizados antes de configurar os critérios de teste.
Escolha o ponto de partida
| Ponto de partida | Workflow |
|---|---|
| Você tem dados de teste JSONL ou CSV com consulta e resposta. | Avaliar conjuntos de dados na nuvem |
| Você tem consultas e deseja que um modelo ou agente gere respostas. | Avaliar modelos e agentes na nuvem |
| Você implantou um modelo ou um agente com rastreamentos do Application Insights. | Avaliar interações de agente e modelo implantados |
| Você tem dados completos das conversas ou rastros de conversas de produção. | Avaliar conversas na nuvem |
| Você precisa de consultas sintéticas ou conversas simuladas. | Gerar dados sintéticos |
| Você precisa sondar, interpretar, cancelar ou solucionar problemas de uma execução. | Obter resultados de avaliação de nuvem |
Para testes de segurança adversariais, use red teaming de IA. Para criar um conjunto de dados autônomo, consulte Gerar um conjunto de dados de avaliação sintética.