Microsoft Foundry SDK를 사용하여 클라우드 평가 소개

클라우드 평가를 사용하여 로컬 컴퓨팅을 관리하지 않고 대규모로 생성 AI 애플리케이션을 테스트합니다. 이 문서에서는 공유 SDK 클라이언트를 설정하고 배포 또는 프로덕션 평가를 위한 워크플로를 선택하는 데 도움이 됩니다.

사전 요구 사항

  • 파운드리 프로젝트.

  • 채팅 완료를 지원하는 GPT 모델을 사용하는 Azure OpenAI 배포(예: gpt-5-mini.)

  • Foundry 프로젝트의 Foundry 사용자 역할입니다.

    Important

    Foundry RBAC 역할의 이름이 최근에 바뀌었습니다. Foundry User, Foundry OwnerFoundry 계정 소유자Foundry Project Manager는 이전에 Azure AI 사용자, Azure AI 소유자, Azure AI 계정 소유자 및 Azure AI Project Manager로 이름이 지정되었습니다. 이름 바꾸기가 롤아웃되는 동안 일부 위치에서는 이전 이름이 계속 표시될 수 있습니다. 역할 ID 및 핵심 권한은 이름 바꾸기에 의해 변경되지 않습니다.

  • 필요에 따라 평가 데이터에 대한 사용자 고유의 스토리지 계정 입니다.

일부 평가 기능에는 지역 제한이 있습니다. 시작하기 전에 지원되는 지역을 검토합니다 .

SDK 클라이언트 설정

언어에 대한 SDK를 설치합니다. 다음 공유 환경 변수를 설정합니다.

  • AZURE_AI_PROJECT_ENDPOINT: 사용자의 Foundry 프로젝트 엔드포인트(예: https://<account_name>.services.ai.azure.com/api/projects/<project_name>).
  • AZURE_AI_MODEL_DEPLOYMENT_NAME: AI 지원 평가자가 사용하는 모델 배포입니다.
  • DATASET_NAMEDATASET_VERSION: 재사용 가능한 데이터 세트에 대한 선택적 값입니다.

DefaultAzureCredential로 인증하고 프로젝트 클라이언트를 만든 다음, 평가 API에서 사용하는 OpenAI 클라이언트를 가져옵니다.

pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
    CreateEvalJSONLRunDataSourceParam,
    SourceFileContent,
    SourceFileContentContent,
    SourceFileID,
)

endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
    "AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")

project_client = AIProjectClient(
    endpoint=endpoint,
    credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()

참조: AIProjectClient, DefaultAzureCredential

관리자 연결을 통해 연결된 모델을 대상, 판단 모델 또는 대화 시뮬레이터로 사용하려면 클라우드 평가에서 관리자 연결 모델 사용을 참조하세요.

평가 워크플로 이해

클라우드 평가에는 다음 세 가지 단계가 있습니다.

  1. 데이터 셰이프 및 점수를 매기는 계산기를 정의합니다.
  2. 평가 클라이언트를 사용하여 평가를 만듭니다.
  3. 실행을 시작하고, 완료될 때까지 폴링한 다음, 채점된 결과를 가져옵니다.

클라우드 평가 결과는 Foundry 프로젝트에 저장됩니다. SDK를 통해 검색하거나, 포털에서 검토하거나, 연결되면 Application Insights로 라우팅할 수 있습니다.

평가자 선택

평가자는 열 매핑을 통해 데이터 필드에 바인딩됩니다. 데이터 세트 워크플로는 항목 필드를 노출하고, 대상 생성 워크플로는 샘플 스키마를 통해 모델 또는 에이전트 출력도 노출합니다.

테스트 조건을 구성하기 전에 기본 제공 평가자사용자 지정 평가자를 검토합니다.

시작점 선택

평가 단위 출발점 Workflow
개별 차례 쿼리 및 응답을 사용하여 JSONL 또는 CSV 테스트 데이터가 있습니다. 쿼리 응답 데이터 세트 평가
개별 차례 쿼리가 있고 모델 또는 에이전트가 응답을 생성하려고 합니다. 모델 및 에이전트 응답 평가
개별 차례 배포된 모델 또는 에이전트와의 개별 상호 작용에서 응답 또는 추적을 저장했습니다. 배포된 모델 및 에이전트 상호 작용 평가
개별 차례 가상 쿼리를 생성해야 합니다. 가상 쿼리 생성
대화 완료 전체 대화의 데이터 세트가 있습니다. 대화 데이터 세트 평가
대화 완료 배포된 모델 또는 에이전트와의 전체 대화를 캡처하는 추적이 있습니다. 배포된 모델 및 에이전트 대화 평가
대화 완료 시뮬레이션된 에이전트 대화를 생성하고 평가해야 합니다. 에이전트 대화 시뮬레이션
모든 평가 단위 실행 상태를 확인하고, 결과를 해석하고, 실행을 취소하거나 문제를 해결해야 합니다. 평가 결과 가져오기

적대적 안전 테스트의 경우 AI 레드 팀을 사용합니다. 독립 실행형 데이터 세트를 만들려면 가상 평가 데이터 세트 생성을 참조하세요.