Einführung in die Cloudauswertung mit Microsoft Foundry SDK

Verwenden Sie Cloud-Auswertungen, um generative KI-Anwendungen im großen Maßstab zu testen, ohne die lokale Berechnung zu verwalten. Dieser Artikel richtet den freigegebenen SDK-Client ein und hilft Ihnen bei der Auswahl eines Workflows für die Vorabbereitstellung oder Produktionsauswertung.

Voraussetzungen

  • Ein Foundry-Projekt.

  • Eine Azure OpenAI-Bereitstellung mit einem GPT-Modell, das Chatvervollständigung unterstützt, wie z. B. gpt-5-mini.

  • Die Rolle " Foundry User " im Foundry-Projekt.

    Important

    Die Foundry-RBAC-Rollen wurden kürzlich umbenannt. Foundry User, Foundry Owner, Foundry Account Owner und Foundry Project Manager wurden zuvor Azure KI-Benutzer, Azure KI-Besitzer, Azure KI-Kontobesitzer und Azure AI Project Manager benannt. Möglicherweise werden die vorherigen Namen an einigen Stellen weiterhin angezeigt, während der Umbenennungsrollout ausgeführt wird. Die Rollen-IDs und Kernberechtigungen bleiben durch die Umbenennung unverändert.

  • Alle Anforderungen an die Auswertungsrolle finden Sie unter "Einrichten von Berechtigungen für Evaluierungsworkflows".

  • Optional kann Ihr eigenes Speicherkonto für Auswertungsdaten verwendet werden.

Einige Auswertungsfeatures weisen regionale Einschränkungen auf. Überprüfen Sie die unterstützten Regionen , bevor Sie beginnen.

Einrichten des SDK-Clients

Installieren Sie das SDK für Ihre Sprache. Legen Sie diese gemeinsamen Umgebungsvariablen fest:

  • AZURE_AI_PROJECT_ENDPOINT: Ihr Foundry-Projektendpunkt, z. B https://<account_name>.services.ai.azure.com/api/projects/<project_name>. .
  • AZURE_AI_MODEL_DEPLOYMENT_NAME: Die Modellbereitstellung für KI-gestützte Bewerter.
  • DATASET_NAME und DATASET_VERSION: Optionale Werte für wiederverwendbare Datasets.

Authentifizieren mit DefaultAzureCredential, erstellen Sie den Projektclient, und rufen Sie den OpenAI-Client ab, der von der Auswertungs-API verwendet wird.

pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
    CreateEvalJSONLRunDataSourceParam,
    SourceFileContent,
    SourceFileContentContent,
    SourceFileID,
)

endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
    "AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")

project_client = AIProjectClient(
    endpoint=endpoint,
    credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()

Referenz: AIProjectClient, DefaultAzureCredential

Informationen zum Verwenden eines Modells, das über Administratorverbindungen als Ziel-, Richtermodell- oder Unterhaltungssimulator verbunden ist, finden Sie unter Verwenden von vom Administrator verbundenen Modellen in Cloudauswertungen.

Grundlegendes zum Auswertungsworkflow

Eine Cloudauswertung umfasst drei Schritte:

  1. Definieren Sie die Datenstruktur und die Auswerter zu ihrer Bewertung.
  2. Erstellen Sie die Auswertung mit dem Auswertungsclient.
  3. Starten Sie einen Durchlauf, fragen Sie den Status ab, bis er abgeschlossen ist, und rufen Sie die bewerteten Ergebnisse ab.

Die Ergebnisse der Cloudauswertung werden in Ihrem Foundry-Projekt gespeichert. Sie können sie über das SDK abrufen, sie im Portal überprüfen oder an Application Insights weiterleiten, wenn sie verbunden sind.

Evaluatoren auswählen

Auswerter werden über Spaltenzuordnungen mit Feldern in Ihren Daten verknüpft. Datasetworkflows stellen Elementfelder bereit, während zielgenerierte Workflows auch die Modell- oder Agent-Ausgabe über das Beispielschema verfügbar machen.

Überprüfen Sie die integrierten Bewerter und benutzerdefinierten Bewerter , bevor Sie Testkriterien konfigurieren.

Auswählen des Startpunkts

Auswertungseinheit Startpunkt Workflow
Einzelner Durchlauf Sie verfügen über JSONL- oder CSV-Testdaten mit einer Abfrage und Antwort. Auswerten von Abfrageantwort-Datasets
Einzelner Durchlauf Sie haben Abfragen und möchten, dass ein Modell oder Agent Antworten generiert. Auswerten von Modell- und Agentantworten
Einzelner Durchlauf Sie haben Antworten oder Protokolle von einzelnen Interaktionen mit einem bereitgestellten Modell oder Agenten gespeichert. Auswerten von bereitgestellten Modell- und Agentinteraktionen
Einzelner Durchlauf Sie müssen synthetische Abfragen generieren. Generieren synthetischer Abfragen
Vollständige Konversation Sie verfügen über ein Dataset vollständiger Unterhaltungen. Konversationsdatensätze auswerten
Vollständige Konversation Es liegen Ablaufverfolgungen vor, die vollständige Unterhaltungen mit einem bereitgestellten Modell oder Agent erfassen. Unterhaltungen mit bereitgestellten Modellen und Agents bewerten
Vollständige Konversation Sie müssen simulierte Agentengespräche generieren und auswerten. Agentgespräche simulieren
Jede Auswertungseinheit Sie müssen einen Lauf abfragen, interpretieren, abbrechen oder Fehler beheben. Abrufen von Auswertungsergebnissen

Verwenden Sie für adversariale Sicherheitstests KI-rotes Teaming. Informationen zum Erstellen eines eigenständigen Datasets finden Sie unter Generieren eines synthetischen Auswertungsdatensatzes.