Ausführen von Cloudauswertungen mit dem Microsoft Foundry SDK

Verwenden Sie Cloud-Auswertungen, um generative KI-Anwendungen im großen Maßstab zu testen, ohne die lokale Berechnung zu verwalten. Dieser Artikel richtet den freigegebenen SDK-Client ein und hilft Ihnen bei der Auswahl eines Workflows für die Vorabbereitstellung oder Produktionsauswertung.

Voraussetzungen

  • Ein Foundry-Projekt.

  • Eine Azure OpenAI-Bereitstellung mit einem GPT-Modell, das Chatvervollständigung unterstützt, wie z. B. gpt-5-mini.

  • Die Rolle " Foundry User " im Foundry-Projekt.

    Important

    Die Foundry-RBAC-Rollen wurden kürzlich umbenannt. Foundry User, Foundry Owner, Foundry Account Owner und Foundry Project Manager wurden zuvor Azure KI-Benutzer, Azure KI-Besitzer, Azure KI-Kontobesitzer und Azure AI Project Manager benannt. Möglicherweise werden die vorherigen Namen an einigen Stellen weiterhin angezeigt, während der Umbenennungsrollout ausgeführt wird. Die Rollen-IDs und Kernberechtigungen bleiben durch die Umbenennung unverändert.

  • Optional kann Ihr eigenes Speicherkonto für Auswertungsdaten verwendet werden.

Einige Auswertungsfeatures weisen regionale Einschränkungen auf. Überprüfen Sie die unterstützten Regionen , bevor Sie beginnen.

Einrichten des SDK-Clients

Installieren Sie das SDK für Ihre Sprache. Legen Sie diese gemeinsamen Umgebungsvariablen fest:

  • AZURE_AI_PROJECT_ENDPOINT: Ihr Foundry-Projektendpunkt, z. B https://<account_name>.services.ai.azure.com/api/projects/<project_name>. .
  • AZURE_AI_MODEL_DEPLOYMENT_NAME: Die Modellbereitstellung für KI-gestützte Bewerter.
  • DATASET_NAME und DATASET_VERSION: Optionale Werte für wiederverwendbare Datasets.

Authentifizieren mit DefaultAzureCredential, erstellen Sie den Projektclient, und rufen Sie den OpenAI-Client ab, der von der Auswertungs-API verwendet wird.

pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
    CreateEvalJSONLRunDataSourceParam,
    SourceFileContent,
    SourceFileContentContent,
    SourceFileID,
)

endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
    "AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")

project_client = AIProjectClient(
    endpoint=endpoint,
    credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()

Informationen zum Verwenden eines Modells, das über Administratorverbindungen als Ziel-, Richtermodell- oder Unterhaltungssimulator verbunden ist, finden Sie unter Verwenden von vom Administrator verbundenen Modellen in Cloudauswertungen.

Grundlegendes zum Auswertungsworkflow

Eine Cloudauswertung umfasst drei Schritte:

  1. Definieren Sie die Datenstruktur und die Auswerter zu ihrer Bewertung.
  2. Erstellen Sie die Auswertung mit openai_client.evals.create().
  3. Starten Sie eine Ausführung mit openai_client.evals.runs.create(), rufen Sie ab, bis sie abgeschlossen ist, und rufen Sie die bewerteten Ergebnisse ab.

Die Ergebnisse der Cloudauswertung werden in Ihrem Foundry-Projekt gespeichert. Sie können sie über das SDK abrufen, sie im Portal überprüfen oder an Application Insights weiterleiten, wenn sie verbunden sind.

Evaluatoren auswählen

Auswerter werden über Spaltenzuordnungen mit Feldern in Ihren Daten verknüpft. Datasetworkflows machen Elementfelder verfügbar, während zielgenerierte Workflows auch die Modell- oder Agentausgabe über das Beispielschema verfügbar machen.

Überprüfen Sie die integrierten Bewerter und benutzerdefinierten Bewerter , bevor Sie Testkriterien konfigurieren.

Auswählen des Startpunkts

Startpunkt Workflow
Sie verfügen über JSONL- oder CSV-Testdaten mit Abfrage und Antwort. Auswerten von Datasets in der Cloud
Sie haben Abfragen und möchten, dass ein Modell oder Agent Antworten generiert. Auswerten von Modellen und Agents in der Cloud
Sie haben ein Modell oder einen Agent mit Application-Insights-Ablaufverfolgung bereitgestellt. Auswerten der bereitgestellten Agent- und Modellinteraktionen
Sie verfügen über vollständige Konversationsdaten oder Konversationsprotokolle aus der Produktion. Bewerten von Unterhaltungen in der Cloud
Sie benötigen synthetische Abfragen oder simulierte Unterhaltungen. Generieren synthetischer Daten
Sie müssen einen Lauf abfragen, interpretieren, abbrechen oder Fehler beheben. Abrufen von Cloudauswertungsergebnissen

Verwenden Sie für adversariale Sicherheitstests KI-rotes Teaming. Informationen zum Erstellen eines eigenständigen Datasets finden Sie unter Generieren eines synthetischen Auswertungsdatensatzes.