Wprowadzenie do oceny chmury za pomocą zestawu SDK Microsoft Foundry

Użyj ocen w chmurze, aby przetestować generowanie aplikacji sztucznej inteligencji na dużą skalę bez zarządzania lokalnymi obliczeniami. Ten artykuł konfiguruje udostępnionego klienta zestawu SDK i pomaga wybrać przepływ pracy do wstępnego wdrożenia lub oceny produkcyjnej.

Wymagania wstępne

  • Projekt Foundry.

  • Wdrożenie usługi Azure OpenAI z modelem GPT obsługującym uzupełnianie czatu, na przykład gpt-5-mini.

  • Rola Użytkownika usługi Foundry w projekcie Foundry.

    Ważna

    Niedawno zmieniono nazwy ról RBAC w usłudze Foundry. Użytkownik Foundry, właściciel Foundry, właściciel konta Foundry i menedżer projektu Foundry były wcześniej nazywane odpowiednio użytkownikiem Azure AI, właścicielem Azure AI, właścicielem konta Azure AI i menedżerem projektu Azure AI. Poprzednie nazwy mogą być nadal widoczne w niektórych miejscach, podczas gdy zmiana nazwy jest wdrażana. Identyfikatory ról i uprawnienia podstawowe są niezmienione przez zmianę nazwy.

  • Opcjonalnie własne konto magazynowe dla danych ewaluacyjnych.

Niektóre funkcje oceny mają ograniczenia regionalne. Przed rozpoczęciem przejrzyj obsługiwane regiony .

Konfigurowanie klienta zestawu SDK

Zainstaluj zestaw SDK dla swojego języka. Ustaw te współużytkowane zmienne środowiskowe:

  • AZURE_AI_PROJECT_ENDPOINT: Punkt końcowy projektu Foundry, na przykład https://<account_name>.services.ai.azure.com/api/projects/<project_name>.
  • AZURE_AI_MODEL_DEPLOYMENT_NAME: Wdrożenie modelu używane przez ewaluatorów wspomaganych przez SI.
  • DATASET_NAME i DATASET_VERSION: Opcjonalne wartości dla zestawów danych wielokrotnego użytku.

Uwierzytelnij się za pomocą DefaultAzureCredential, utwórz klienta projektu i uzyskaj klienta OpenAI używanego przez interfejs API oceniania.

pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
    CreateEvalJSONLRunDataSourceParam,
    SourceFileContent,
    SourceFileContentContent,
    SourceFileID,
)

endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
    "AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")

project_client = AIProjectClient(
    endpoint=endpoint,
    credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()

Aby użyć modelu połączonego za pośrednictwem połączeń administracyjnych jako modelu docelowego, modelu sędziego lub symulatora konwersacji, zobacz Używanie modeli połączonych przez administratora w ocenach chmury.

Omówienie przepływu pracy oceny

Ocena chmury obejmuje trzy kroki:

  1. Zdefiniuj kształt danych i ewaluatorów, którzy go oceniają.
  2. Utwórz ocenę za pomocą polecenia openai_client.evals.create().
  3. Rozpocznij uruchomienie za pomocą openai_client.evals.runs.create(), sprawdzaj stan do jego zakończenia, a następnie pobierz ocenione wyniki.

Wyniki oceny chmury są przechowywane w projekcie Foundry. Można je pobrać za pośrednictwem zestawu SDK, przejrzeć je w portalu lub kierować je do usługi Application Insights po nawiązaniu połączenia.

Wybieranie ewaluatorów

Ewaluatorzy wiążą się z polami w danych za pomocą mapowań kolumn. Przepływy pracy zestawów danych uwidaczniają pola elementów, podczas gdy generowane przez element docelowy przepływy pracy uwidaczniają również dane wyjściowe modelu lub agenta za pomocą przykładowego schematu.

Przed skonfigurowaniem kryteriów testowania zapoznaj się z wbudowanymi ewaluatorami i niestandardowymi ewaluatorami .

Wybieranie punktu początkowego

Jednostka oceny Punkt początkowy Workflow
Pojedynczy obrót Masz dane testowe JSONL lub CSV z zapytaniem i odpowiedzią. Ocena zestawów danych odpowiedzi na zapytania
Pojedynczy obrót Masz zapytania i chcesz, aby model lub agent wygenerował odpowiedzi. Ocena odpowiedzi modelu i agenta
Obrót pojedynczy Masz przechowywane odpowiedzi lub ślady z poszczególnych interakcji z wdrożonym modelem lub agentem. Ocena wdrożonych interakcji z modelem i agentem
Pojedynczy obrót Należy wygenerować zapytania syntetyczne. Generowanie zapytań syntetycznych
Ukończ konwersację Masz zestaw danych pełnych konwersacji. Ocena zestawów danych konwersacji
Ukończ konwersację Masz ślady, które rejestrują całe rozmowy z wdrożonym modelem lub agentem. Ocena wdrożonych konwersacji modelu i agenta
Ukończ konwersację Musisz wygenerować i ocenić symulowane konwersacje agenta. Symulowanie konwersacji agenta
Dowolna jednostka oceny Musisz sprawdzać status, interpretować, anulować lub diagnozować problemy z uruchomieniem. Pobieranie wyników oceny

Do adwersaryjnych testów bezpieczeństwa użyj red teamingu AI. Aby utworzyć autonomiczny zestaw danych, zobacz Generowanie syntetycznego zestawu danych oceny.