클라우드 평가를 사용하여 로컬 컴퓨팅을 관리하지 않고 대규모로 생성 AI 애플리케이션을 테스트합니다. 이 문서에서는 공유 SDK 클라이언트를 설정하고 배포 또는 프로덕션 평가를 위한 워크플로를 선택하는 데 도움이 됩니다.
사전 요구 사항
채팅 완료를 지원하는 GPT 모델을 사용하는 Azure OpenAI 배포(예:
gpt-5-mini.)Foundry 프로젝트의 Foundry 사용자 역할입니다.
Important
Foundry RBAC 역할의 이름이 최근에 바뀌었습니다. Foundry User, Foundry OwnerFoundry 계정 소유자 및 Foundry Project Manager는 이전에 Azure AI 사용자, Azure AI 소유자, Azure AI 계정 소유자 및 Azure AI Project Manager로 이름이 지정되었습니다. 이름 바꾸기가 롤아웃되는 동안 일부 위치에서는 이전 이름이 계속 표시될 수 있습니다. 역할 ID 및 핵심 권한은 이름 바꾸기에 의해 변경되지 않습니다.
필요에 따라 평가 데이터에 대한 사용자 고유의 스토리지 계정 입니다.
일부 평가 기능에는 지역 제한이 있습니다. 시작하기 전에 지원되는 지역을 검토합니다 .
SDK 클라이언트 설정
언어에 대한 SDK를 설치합니다. 다음 공유 환경 변수를 설정합니다.
-
AZURE_AI_PROJECT_ENDPOINT: 사용자의 Foundry 프로젝트 엔드포인트(예:https://<account_name>.services.ai.azure.com/api/projects/<project_name>). -
AZURE_AI_MODEL_DEPLOYMENT_NAME: AI 지원 평가자가 사용하는 모델 배포입니다. -
DATASET_NAME및DATASET_VERSION: 재사용 가능한 데이터 세트에 대한 선택적 값입니다.
DefaultAzureCredential로 인증하고 프로젝트 클라이언트를 만든 다음, 평가 API에서 사용하는 OpenAI 클라이언트를 가져옵니다.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
관리자 연결을 통해 연결된 모델을 대상, 판단 모델 또는 대화 시뮬레이터로 사용하려면 클라우드 평가에서 관리자 연결 모델 사용을 참조하세요.
평가 워크플로 이해
클라우드 평가에는 다음 세 가지 단계가 있습니다.
- 데이터 셰이프 및 점수를 매기는 계산기를 정의합니다.
- 평가 클라이언트를 사용하여 평가를 만듭니다.
- 실행을 시작하고, 완료될 때까지 폴링한 다음, 채점된 결과를 가져옵니다.
클라우드 평가 결과는 Foundry 프로젝트에 저장됩니다. SDK를 통해 검색하거나, 포털에서 검토하거나, 연결되면 Application Insights로 라우팅할 수 있습니다.
평가자 선택
평가자는 열 매핑을 통해 데이터 필드에 바인딩됩니다. 데이터 세트 워크플로는 항목 필드를 노출하고, 대상 생성 워크플로는 샘플 스키마를 통해 모델 또는 에이전트 출력도 노출합니다.
테스트 조건을 구성하기 전에 기본 제공 평가자 및 사용자 지정 평가자를 검토합니다.
시작점 선택
| 평가 단위 | 출발점 | Workflow |
|---|---|---|
| 개별 차례 | 쿼리 및 응답을 사용하여 JSONL 또는 CSV 테스트 데이터가 있습니다. | 쿼리 응답 데이터 세트 평가 |
| 개별 차례 | 쿼리가 있고 모델 또는 에이전트가 응답을 생성하려고 합니다. | 모델 및 에이전트 응답 평가 |
| 개별 차례 | 배포된 모델 또는 에이전트와의 개별 상호 작용에서 응답 또는 추적을 저장했습니다. | 배포된 모델 및 에이전트 상호 작용 평가 |
| 개별 차례 | 가상 쿼리를 생성해야 합니다. | 가상 쿼리 생성 |
| 대화 완료 | 전체 대화의 데이터 세트가 있습니다. | 대화 데이터 세트 평가 |
| 대화 완료 | 배포된 모델 또는 에이전트와의 전체 대화를 캡처하는 추적이 있습니다. | 배포된 모델 및 에이전트 대화 평가 |
| 대화 완료 | 시뮬레이션된 에이전트 대화를 생성하고 평가해야 합니다. | 에이전트 대화 시뮬레이션 |
| 모든 평가 단위 | 실행 상태를 확인하고, 결과를 해석하고, 실행을 취소하거나 문제를 해결해야 합니다. | 평가 결과 가져오기 |
적대적 안전 테스트의 경우 AI 레드 팀을 사용합니다. 독립 실행형 데이터 세트를 만들려면 가상 평가 데이터 세트 생성을 참조하세요.