Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Użyj ocen w chmurze, aby przetestować generowanie aplikacji sztucznej inteligencji na dużą skalę bez zarządzania lokalnymi obliczeniami. Ten artykuł konfiguruje udostępnionego klienta zestawu SDK i pomaga wybrać przepływ pracy do wstępnego wdrożenia lub oceny produkcyjnej.
Wymagania wstępne
Wdrożenie usługi Azure OpenAI z modelem GPT obsługującym uzupełnianie czatu, na przykład
gpt-5-mini.Rola Użytkownika usługi Foundry w projekcie Foundry.
Ważna
Niedawno zmieniono nazwy ról RBAC w usłudze Foundry. Użytkownik Foundry, właściciel Foundry, właściciel konta Foundry i menedżer projektu Foundry były wcześniej nazywane odpowiednio użytkownikiem Azure AI, właścicielem Azure AI, właścicielem konta Azure AI i menedżerem projektu Azure AI. Poprzednie nazwy mogą być nadal widoczne w niektórych miejscach, podczas gdy zmiana nazwy jest wdrażana. Identyfikatory ról i uprawnienia podstawowe są niezmienione przez zmianę nazwy.
Opcjonalnie własne konto magazynowe dla danych ewaluacyjnych.
Niektóre funkcje oceny mają ograniczenia regionalne. Przed rozpoczęciem przejrzyj obsługiwane regiony .
Konfigurowanie klienta zestawu SDK
Zainstaluj zestaw SDK dla swojego języka. Ustaw te współużytkowane zmienne środowiskowe:
-
AZURE_AI_PROJECT_ENDPOINT: Punkt końcowy projektu Foundry, na przykładhttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: Wdrożenie modelu używane przez ewaluatorów wspomaganych przez SI. -
DATASET_NAMEiDATASET_VERSION: Opcjonalne wartości dla zestawów danych wielokrotnego użytku.
Uwierzytelnij się za pomocą DefaultAzureCredential, utwórz klienta projektu i uzyskaj klienta OpenAI używanego przez interfejs API oceniania.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Aby użyć modelu połączonego za pośrednictwem połączeń administracyjnych jako modelu docelowego, modelu sędziego lub symulatora konwersacji, zobacz Używanie modeli połączonych przez administratora w ocenach chmury.
Omówienie przepływu pracy oceny
Ocena chmury obejmuje trzy kroki:
- Zdefiniuj kształt danych i ewaluatorów, którzy go oceniają.
- Utwórz ocenę za pomocą polecenia
openai_client.evals.create(). - Rozpocznij uruchomienie za pomocą
openai_client.evals.runs.create(), sprawdzaj stan do jego zakończenia, a następnie pobierz ocenione wyniki.
Wyniki oceny chmury są przechowywane w projekcie Foundry. Można je pobrać za pośrednictwem zestawu SDK, przejrzeć je w portalu lub kierować je do usługi Application Insights po nawiązaniu połączenia.
Wybieranie ewaluatorów
Ewaluatorzy wiążą się z polami w danych za pomocą mapowań kolumn. Przepływy pracy zestawów danych uwidaczniają pola elementów, podczas gdy generowane przez element docelowy przepływy pracy uwidaczniają również dane wyjściowe modelu lub agenta za pomocą przykładowego schematu.
Przed skonfigurowaniem kryteriów testowania zapoznaj się z wbudowanymi ewaluatorami i niestandardowymi ewaluatorami .
Wybieranie punktu początkowego
| Jednostka oceny | Punkt początkowy | Workflow |
|---|---|---|
| Pojedynczy obrót | Masz dane testowe JSONL lub CSV z zapytaniem i odpowiedzią. | Ocena zestawów danych odpowiedzi na zapytania |
| Pojedynczy obrót | Masz zapytania i chcesz, aby model lub agent wygenerował odpowiedzi. | Ocena odpowiedzi modelu i agenta |
| Obrót pojedynczy | Masz przechowywane odpowiedzi lub ślady z poszczególnych interakcji z wdrożonym modelem lub agentem. | Ocena wdrożonych interakcji z modelem i agentem |
| Pojedynczy obrót | Należy wygenerować zapytania syntetyczne. | Generowanie zapytań syntetycznych |
| Ukończ konwersację | Masz zestaw danych pełnych konwersacji. | Ocena zestawów danych konwersacji |
| Ukończ konwersację | Masz ślady, które rejestrują całe rozmowy z wdrożonym modelem lub agentem. | Ocena wdrożonych konwersacji modelu i agenta |
| Ukończ konwersację | Musisz wygenerować i ocenić symulowane konwersacje agenta. | Symulowanie konwersacji agenta |
| Dowolna jednostka oceny | Musisz sprawdzać status, interpretować, anulować lub diagnozować problemy z uruchomieniem. | Pobieranie wyników oceny |
Do adwersaryjnych testów bezpieczeństwa użyj red teamingu AI. Aby utworzyć autonomiczny zestaw danych, zobacz Generowanie syntetycznego zestawu danych oceny.