Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Utilisez des évaluations cloud pour tester des applications IA génératives à grande échelle sans gérer le calcul local. Cet article configure le client du Kit de développement logiciel (SDK) partagé et vous aide à choisir un flux de travail pour la prédéploiement ou l’évaluation de production.
Prerequisites
Un projet Foundry.
Un déploiement Azure OpenAI avec un modèle GPT déployé qui prend en charge la complétion de conversation (par exemple,
gpt-5-mini).Rôle Utilisateur Foundry sur le projet Foundry.
Important
Les rôles Foundry RBAC ont été récemment renommés. Foundry User, Foundry Owner, Propriétaire du compteFoundry et Foundry Project Manager ont été précédemment nommés Azure utilisateur IA, Azure propriétaire d’IA, propriétaire Azure compte IA et Azure gestionnaire Project IA. Il se peut que vous voyiez encore les anciens noms à certains endroits pendant le déploiement de ce changement de nom. Les ID de rôle et les autorisations de base ne sont pas modifiés par ce changement de nom.
Si vous le souhaitez, votre propre compte de stockage pour les données d’évaluation.
Certaines fonctionnalités d’évaluation ont des restrictions régionales. Passez en revue les régions prises en charge avant de commencer.
Configurer le client du Kit de développement logiciel (SDK)
Installez le Kit de développement logiciel (SDK) pour votre langue. Définissez ces variables d’environnement partagé :
-
AZURE_AI_PROJECT_ENDPOINT: point de terminaison de votre projet Foundry, par exemplehttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: Le déploiement du modèle utilisé par les évaluateurs assistés par l’IA. -
DATASET_NAMEetDATASET_VERSION: valeurs facultatives pour les jeux de données réutilisables.
Authentifiez-vous avec DefaultAzureCredential, créez le client de projet et obtenez le client OpenAI utilisé par l’API d’évaluation.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Pour utiliser un modèle connecté via des connexions d’administration en tant que cible, modèle de juge ou simulateur de conversation, consultez Utiliser des modèles connectés par l’administrateur dans les évaluations cloud.
Comprendre le flux de travail d’évaluation
Une évaluation cloud comporte trois étapes :
- Définissez la forme de données et les évaluateurs qui les notent.
- Créez l’évaluation avec
openai_client.evals.create(). - Démarrez une exécution avec
openai_client.evals.runs.create(), interrogez jusqu’à ce qu’elle se termine et récupérez les résultats marqués.
Les résultats de l’évaluation cloud sont stockés dans votre projet Foundry. Vous pouvez les récupérer via le Kit de développement logiciel (SDK), les examiner dans le portail ou les router vers Application Insights lorsqu’il est connecté.
Choisir des évaluateurs
Les évaluateurs sont liés à des champs dans vos données via des mappages de colonnes. Les flux de travail d’ensemble de données exposent les champs des éléments, tandis que les flux de travail générés à partir de la cible exposent également la sortie du modèle ou de l’assistant via le schéma de l’exemple.
Passez en revue les évaluateurs intégrés et les évaluateurs personnalisés avant de configurer les critères de test.
Choisir votre point de départ
| Unité d’évaluation | Point de départ | Workflow |
|---|---|---|
| Tour de rôle individuel | Vous disposez de données de test JSONL ou CSV avec une requête et une réponse. | Évaluer les jeux de données de réponse aux requêtes |
| Tour de rôle individuel | Vous avez des requêtes et souhaitez qu’un modèle ou un agent génère des réponses. | Évaluer les réponses du modèle et de l’agent |
| Tour individuel | Vous avez stocké des réponses ou des traces à partir d’interactions individuelles avec un modèle ou un agent déployé. | Évaluer les interactions de modèle et d’agent déployées |
| Tour individuel | Vous devez générer des requêtes synthétiques. | Générer des requêtes synthétiques |
| Terminer la conversation | Vous disposez d’un jeu de données de conversations complètes. | Évaluer les jeux de données de conversation |
| Terminer la conversation | Vous disposez de traces qui capturent des conversations complètes avec un modèle ou un agent déployé. | Évaluer le modèle déployé et les conversations d’agent |
| Terminer la conversation | Vous devez générer et évaluer des conversations d’agent simulées. | Simuler des conversations d’agent |
| Toute unité d’évaluation | Vous devez interroger, interpréter, annuler ou résoudre les problèmes liés à une exécution. | Obtenir les résultats de l’évaluation |
Pour les tests de sécurité en conditions adverses, utilisez le Red teaming de l’IA. Pour créer un jeu de données autonome, consultez Générer un jeu de données d’évaluation synthétique.