Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Utilize avaliações na cloud para testar aplicações de IA generativa em larga escala, sem gerir computação local. Este artigo configura o cliente SDK partilhado e ajuda-o a escolher um fluxo de trabalho para pré-implementação ou avaliação em produção.
Pré-requisitos
Uma implementação do Azure OpenAI com um modelo GPT que suporta a conclusão de chats, como
gpt-5-mini.A função Foundry User no projeto Foundry.
Importante
As funções RBAC do Foundry foram recentemente renomeadas. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager foram anteriormente nomeados Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. Poderá ainda ver os nomes anteriores em alguns locais enquanto esta alteração de nome está a ser implementada. Os IDs das funções e as permissões principais não são alterados por esta mudança de nome.
Opcionalmente, a sua própria conta de armazenamento para dados de avaliação.
Algumas funcionalidades de avaliação têm restrições regionais. Revise as regiões suportadas antes de começar.
Configurar o cliente SDK
Instala o SDK para a tua língua. Defina estas variáveis de ambiente partilhadas:
-
AZURE_AI_PROJECT_ENDPOINT: O endpoint do seu projeto Foundry, por exemplo,https://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: A implementação do modelo utilizada por avaliadores assistidos por IA. -
DATASET_NAMEeDATASET_VERSION: Valores opcionais para conjuntos de dados reutilizáveis.
Autentica com DefaultAzureCredential, cria o cliente do projeto e faz com que o cliente OpenAI seja usado pela API de avaliação.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Para usar um modelo ligado através de ligações administrativas como alvo, modelo de juízo ou simulador de conversa, veja Utilizar modelos ligados ao administrador em avaliações na cloud.
Compreenda o fluxo de trabalho de avaliação
Uma avaliação na nuvem tem três passos:
- Defina a forma dos dados e os avaliadores que a avaliam.
- Crie a avaliação com
openai_client.evals.create(). - Inicie uma execução com
openai_client.evals.runs.create(), faça sondagens até concluir e recupere os resultados pontuados.
Os resultados das avaliações na cloud são armazenados no seu projeto Foundry. Pode obtê-los através do SDK, revê-los no portal ou encaminhá-los para o Application Insights quando este estiver ligado.
Escolha avaliadores
Os avaliadores associam campos nos seus dados através de mapeamentos de colunas. Os fluxos de trabalho do conjunto de dados expõem campos de itens, enquanto os fluxos de trabalho gerados pelo destino também expõem a saída do modelo ou do agente através do esquema da amostra.
Revise os avaliadores incorporados e os avaliadores personalizados antes de configurar os critérios de teste.
Escolhe o teu ponto de partida
| Ponto de partida | Workflow |
|---|---|
| Tens dados de teste JSONL ou CSV com consulta e resposta. | Avaliar conjuntos de dados na cloud |
| Tens dúvidas e queres um modelo ou agente para gerar respostas. | Avaliar modelos e agentes na cloud |
| Implementou um modelo ou um agente com rastreios do Application Insights. | Avaliar as interações entre agentes e modelos implementadas |
| Dispõe de dados completos de conversas ou de rastos de conversas em produção. | Avaliar conversas na cloud |
| Precisas de consultas sintéticas ou conversas simuladas. | Gerar dados sintéticos |
| Precisas de questionar, interpretar, cancelar ou resolver problemas numa execução. | Obtenha resultados de avaliação na cloud |
Para testes adversariais de segurança, use red teaming com IA. Para criar um conjunto de dados autónomo, veja Gerar um conjunto de dados de avaliação sintética.