Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Verwenden Sie Cloud-Auswertungen, um generative KI-Anwendungen im großen Maßstab zu testen, ohne die lokale Berechnung zu verwalten. Dieser Artikel richtet den freigegebenen SDK-Client ein und hilft Ihnen bei der Auswahl eines Workflows für die Vorabbereitstellung oder Produktionsauswertung.
Voraussetzungen
Ein Foundry-Projekt.
Eine Azure OpenAI-Bereitstellung mit einem GPT-Modell, das Chatvervollständigung unterstützt, wie z. B.
gpt-5-mini.Die Rolle " Foundry User " im Foundry-Projekt.
Important
Die Foundry-RBAC-Rollen wurden kürzlich umbenannt. Foundry User, Foundry Owner, Foundry Account Owner und Foundry Project Manager wurden zuvor Azure KI-Benutzer, Azure KI-Besitzer, Azure KI-Kontobesitzer und Azure AI Project Manager benannt. Möglicherweise werden die vorherigen Namen an einigen Stellen weiterhin angezeigt, während der Umbenennungsrollout ausgeführt wird. Die Rollen-IDs und Kernberechtigungen bleiben durch die Umbenennung unverändert.
Alle Anforderungen an die Auswertungsrolle finden Sie unter "Einrichten von Berechtigungen für Evaluierungsworkflows".
Optional kann Ihr eigenes Speicherkonto für Auswertungsdaten verwendet werden.
Einige Auswertungsfeatures weisen regionale Einschränkungen auf. Überprüfen Sie die unterstützten Regionen , bevor Sie beginnen.
Einrichten des SDK-Clients
Installieren Sie das SDK für Ihre Sprache. Legen Sie diese gemeinsamen Umgebungsvariablen fest:
-
AZURE_AI_PROJECT_ENDPOINT: Ihr Foundry-Projektendpunkt, z. Bhttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. . -
AZURE_AI_MODEL_DEPLOYMENT_NAME: Die Modellbereitstellung für KI-gestützte Bewerter. -
DATASET_NAMEundDATASET_VERSION: Optionale Werte für wiederverwendbare Datasets.
Authentifizieren mit DefaultAzureCredential, erstellen Sie den Projektclient, und rufen Sie den OpenAI-Client ab, der von der Auswertungs-API verwendet wird.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Referenz: AIProjectClient, DefaultAzureCredential
Informationen zum Verwenden eines Modells, das über Administratorverbindungen als Ziel-, Richtermodell- oder Unterhaltungssimulator verbunden ist, finden Sie unter Verwenden von vom Administrator verbundenen Modellen in Cloudauswertungen.
Grundlegendes zum Auswertungsworkflow
Eine Cloudauswertung umfasst drei Schritte:
- Definieren Sie die Datenstruktur und die Auswerter zu ihrer Bewertung.
- Erstellen Sie die Auswertung mit dem Auswertungsclient.
- Starten Sie einen Durchlauf, fragen Sie den Status ab, bis er abgeschlossen ist, und rufen Sie die bewerteten Ergebnisse ab.
Die Ergebnisse der Cloudauswertung werden in Ihrem Foundry-Projekt gespeichert. Sie können sie über das SDK abrufen, sie im Portal überprüfen oder an Application Insights weiterleiten, wenn sie verbunden sind.
Evaluatoren auswählen
Auswerter werden über Spaltenzuordnungen mit Feldern in Ihren Daten verknüpft. Datasetworkflows stellen Elementfelder bereit, während zielgenerierte Workflows auch die Modell- oder Agent-Ausgabe über das Beispielschema verfügbar machen.
Überprüfen Sie die integrierten Bewerter und benutzerdefinierten Bewerter , bevor Sie Testkriterien konfigurieren.
Auswählen des Startpunkts
| Auswertungseinheit | Startpunkt | Workflow |
|---|---|---|
| Einzelner Durchlauf | Sie verfügen über JSONL- oder CSV-Testdaten mit einer Abfrage und Antwort. | Auswerten von Abfrageantwort-Datasets |
| Einzelner Durchlauf | Sie haben Abfragen und möchten, dass ein Modell oder Agent Antworten generiert. | Auswerten von Modell- und Agentantworten |
| Einzelner Durchlauf | Sie haben Antworten oder Protokolle von einzelnen Interaktionen mit einem bereitgestellten Modell oder Agenten gespeichert. | Auswerten von bereitgestellten Modell- und Agentinteraktionen |
| Einzelner Durchlauf | Sie müssen synthetische Abfragen generieren. | Generieren synthetischer Abfragen |
| Vollständige Konversation | Sie verfügen über ein Dataset vollständiger Unterhaltungen. | Konversationsdatensätze auswerten |
| Vollständige Konversation | Es liegen Ablaufverfolgungen vor, die vollständige Unterhaltungen mit einem bereitgestellten Modell oder Agent erfassen. | Unterhaltungen mit bereitgestellten Modellen und Agents bewerten |
| Vollständige Konversation | Sie müssen simulierte Agentengespräche generieren und auswerten. | Agentgespräche simulieren |
| Jede Auswertungseinheit | Sie müssen einen Lauf abfragen, interpretieren, abbrechen oder Fehler beheben. | Abrufen von Auswertungsergebnissen |
Verwenden Sie für adversariale Sicherheitstests KI-rotes Teaming. Informationen zum Erstellen eines eigenständigen Datasets finden Sie unter Generieren eines synthetischen Auswertungsdatensatzes.