빠른 시작: 호스팅된 에이전트 평가하기

참고

Azure 개발자 CLI 평가 환경은 현재 미리 보기로 제공됩니다.

이 빠른 시작에서는 첫 번째 호스팅 에이전트 배포에서 배포한 호스팅 에이전트를 평가합니다. 테스트 데이터 세트를 제공하고, 평가자를 선택하고, 배포된 에이전트에 대해 평가를 실행하고, 점수를 검토합니다. 각 단계에서는 Azure 개발자 CLI(azd), Microsoft Foundry 포털, Python SDK, C# SDK 및 JavaScript/TypeScript SDK와 같은 5가지 작업을 수행하는 방법을 보여 줍니다.

평가는 에이전트에 대한 품질 기준을 설정하고 사용자에게 변경 내용을 릴리스하기 전에 작업 준수 전달 속도와 같은 수용 임계값을 설정할 수 있습니다.

사전 요구 사항

이 작업을 시작하려면 다음이 필요합니다.

  • 첫 번째 호스팅 에이전트 배포의 배포되어 호출 가능한 호스팅 에이전트입니다. Azure Developer CLI 경로의 경우, 해당 빠른 시작에서 만든 azd 프로젝트 디렉터리도 필요합니다.

  • Foundry 리소스의 Foundry User 역할입니다.

  • 응답을 평가하는 심사 모델로 사용할 동일한 Foundry 프로젝트 내 채팅 완성 모델 배포입니다. 이전 빠른 시작의 모델 배포를 포함하여 에이전트에서 이미 사용하는 모델 배포를 다시 사용할 수 있으므로 별도의 배포가 필요하지 않습니다.

    Important

    Foundry RBAC 역할의 이름이 최근에 바뀌었습니다. Foundry User, Foundry OwnerFoundry 계정 소유자 및 Foundry Project Manager는 이전에 Azure AI 사용자, Azure AI 소유자, Azure AI 계정 소유자 및 Azure AI Project Manager로 이름이 지정되었습니다. 이름 바꾸기가 롤아웃되는 동안 일부 위치에서는 이전 이름이 계속 표시될 수 있습니다. 역할 ID 및 핵심 권한은 이름 바꾸기에 의해 변경되지 않습니다.

모든 평가 역할 요구 사항은 평가 워크플로에 대한 권한 설정을 참조하세요.

각 단계에서는 5개의 경로를 제공합니다. 원하는 항목을 사용합니다.

  • Azure Developer CLI: azd ai agent 명령을 제공하는 azure.ai.agents 확장(azd ai agent eval), 버전 0.1.40-프리뷰 이상 이 확장은 이전 빠른 시작에서 설치한 microsoft.foundry 확장에 포함되어 있습니다. 설치된 버전을 azd ext list확인하고 필요한 경우 실행 azd ext upgrade microsoft.foundry 합니다. azd auth login로 로그인합니다.
  • Foundry 포털: Foundry 포털에 접속할 수 있습니다.
  • Python SDK: Python 3.10 이상, 그리고 DefaultAzureCredential가 인증할 수 있도록 az login로 로그인한 Azure CLI. 설치에 대한 내용은 Azure CLI 설치를 참조하세요.
  • C# SDK: .NET 10 SDK 이상, 그리고 DefaultAzureCredential가 인증할 수 있도록 az login로 로그인된 Azure CLI.
  • JavaScript/TypeScript SDK: Node.js 20 LTS 이상, 그리고 az login이 인증할 수 있도록 DefaultAzureCredential로 로그인된 Azure CLI

1단계: 배포한 에이전트를 확인하세요

평가는 배포된 호출 가능한 에이전트에 대해 실행됩니다. 평가를 설정하기 전에 에이전트가 배포되고 사용 가능한지 확인합니다.

프로젝트 디렉터리에서 에이전트가 배포되고 호출 가능한지 확인합니다 azd .

azd ai agent show

테스트 프롬프트 보내기:

azd ai agent invoke "Write a haiku about deploying cloud applications."

몇 초 내에 응답이 표시됩니다.

2단계: 기본 제공 평가자 설정

테스트 데이터 세트에 대해 에이전트의 점수를 매기려면 기본 제공 평가자로 시작합니다.

먼저 에이전트에 대한 테스트 쿼리의 JSONL 파일을 만듭니다. 각 줄은 query 필드가 있는 JSON 객체입니다. 다음과 같이 src/<your-agent-name>/tests/queries.jsonl에이전트의 원본 폴더 내에 저장합니다.

{"query": "Write a haiku about deploying cloud applications."}

그런 다음 같은 에이전트 소스 폴더에 eval.yaml 파일을 src/<your-agent-name>/eval.yaml로 만듭니다. 데이터 세트를 가리키고 적용할 기본 제공 평가기를 나열합니다. 경로는 dataset.local_uri 이 폴더를 기준으로 합니다. <your-agent-name> 을(를) 호스팅된 에이전트 이름으로, <your-chat-completion-deployment>을(를) 판정 모델 배포로 바꾸세요.

name: agent-eval
agent:
  name: <your-agent-name>
  kind: hosted
dataset:
  local_uri: tests/queries.jsonl
evaluators:
  - builtin.intent_resolution
  - builtin.task_adherence
options:
  eval_model: <your-chat-completion-deployment>
max_samples: 15

eval_model 값은 응답을 채점하는 심사 모델이며, 에이전트가 이미 사용 중인 배포를 재사용할 수 있습니다.

3단계: 평가 실행

배포한 에이전트를 대상으로 테스트 스위트를 실행하세요. 서비스는 각 테스트 쿼리를 에이전트에 보내고, 응답을 캡처하고, 선택한 평가자를 사용하여 점수를 매깁니다.

참고

대상 기반 평가는 호스트된 에이전트를 직접 호출합니다. 응답 또는 호출 프로토콜을 동기식 비 스트리밍 실행과 함께 사용하는 에이전트에서 작동합니다. A2A 또는 Activity 프로토콜을 사용하거나 장기 실행 또는 스트리밍과 같은 다른 실행 패턴을 따르는 에이전트를 평가하려면, 대신 에이전트가 생성하는 추적을 평가하세요. 추적 평가를 참조하세요.

azd 작업 영역 루트에서 평가를 실행합니다.

azd ai agent eval run --config eval.yaml

참고

azd ai agent eval run는 --config 경로를 현재 디렉터리가 아니라 src/ 아래에 있는 에이전트의 소스 폴더(예: src/<your-agent-name>/eval.yaml)를 기준으로 확인합니다. eval.yaml 및 이 local_uri가 가리키는 데이터 세트를 해당 폴더 안에 유지하세요.

이 명령은 각 쿼리를 읽고 eval.yaml, 에이전트에 보내고, 응답의 점수를 매기고, 완료 시 요약을 출력합니다.

Eval run started
   Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
   Run:  evalrun_5f72ef189ad24790a32128e6f230b131
   (✓) Done  Eval run

Results:    1 total, 1 passed, 0 failed, 0 errored

Per-criteria results:
  intent_resolution: 1 passed, 0 failed, 0 errored
  task_adherence: 1 passed, 0 failed, 0 errored

4단계: 결과 검토

일반적으로 평가는 쿼리 수에 따라 몇 분 안에 완료됩니다.

최근 평가를 나열합니다.

azd ai agent eval list
    Eval ID                                Name        Status of last run  Runs
    -------                                ----        ------------------  ----
*   eval_b36748dede424e4ba3f8e6c99ca2cf27  agent-eval  Completed           1

* = active eval in current environment

가장 최근의 평가 및 해당 실행을 표시합니다.

azd ai agent eval show
Eval:   eval_b36748dede424e4ba3f8e6c99ca2cf27
Name:   agent-eval
Agent:  <your-agent-name>
Runs:   1

Recent runs:
  Run ID                                    Status     Passed  Failed  Created
  ------                                    ------     ------  ------  -------
  evalrun_5f72ef189ad24790a32128e6f230b131  Completed  1/1     0       2026-06-17 14:52 UTC

결과를 사용하여 평가된 에이전트 버전과 생성된 평가자 점수를 확인합니다. Foundry 포털에서 평가자별 세부 정보 및 보고서에 대한 링크를 보려면 다음을 실행합니다 azd ai agent eval show <eval-id> --eval-run-id <run-id>.

자원을 정리하세요

이 빠른 시작에서는 Foundry 프로젝트에서 데이터 세트, 평가 및 실행 기록을 등록합니다. 이러한 자산에는 지속적인 비용이 거의 또는 전혀 발생하지 않습니다.

호스트된 에이전트 및 사용자가 만든 Azure 리소스를 제거하려면 첫 번째 호스팅 에이전트 배포의 정리 단계를 따릅니다.

Troubleshooting

Issue 해결 방법
azd ai agent eval 명령을 찾을 수 없음 azd ext list을 실행하고 azd ai agent 확장이 0.1.40-preview 이상인지 확인합니다. azd ext upgrade microsoft.foundry로 업그레이드하세요.
azd ai agent eval run 에이전트를 찾지 못함 에이전트가 배포되고 호출 가능한지 확인합니다 azd ai agent show. 필요한 경우 azd deploy로 다시 배포합니다.
ModuleNotFoundError 또는 azure.ai.projects용 azure.identity SDK를 설치합니다 pip install "azure-ai-projects>=2.0.0" azure-identity.
C#: The type or namespace name 'Evals' (or 'AIProjectClient') could not be found 패키지를 추가합니다. dotnet add package Azure.AI.Projects --prereleasedotnet add package OpenAIdotnet add package Azure.Identity
AuthenticationError, DefaultAzureCredential또는 Forbidden 실패 az login로 로그인하고(또는 CLI 경로의 경우 azd auth login로), 프로젝트에서 Foundry 사용자 역할이 있는지 확인합니다. 또한 데이터 세트 업로드에는 프로젝트의 스토리지에 대한 쓰기 액세스 권한이 필요합니다. 모든 역할 요구 사항은 평가 워크플로에 대한 권한 설정을 참조하세요.
에이전트 대상을 찾을 수 없음 에이전트 이름 및 버전을 확인합니다project_client.agents.get("<your-agent-name>").project_client.agents.list()
오류가 있는 행이 많거나 점수가 예상보다 낮음 보고서 URL을 열고 에이전트 응답 또는 계산기 오류로 행이 실패했는지 확인합니다. 기본 오류를 수정한 다음 평가를 다시 실행합니다.
Eval 모델 배포를 찾을 수 없음 프로젝트의 FOUNDRY_MODEL_NAMEeval_modeleval.yaml 아래에 판정 모델 배포(SDK용 또는 >의 )가 있는지 확인합니다.

배운 내용

이 빠른 시작에서 당신은 다음을 수행합니다.

  • 테스트 데이터 세트를 만들고 호스트된 에이전트에 대한 평가자를 선택했습니다.
  • 배포된 에이전트에 대해 평가를 실행했습니다.
  • 집계된 결과 및 행 수준 결과를 검토했습니다.
  • Azure Developer CLI, Foundry 포털, Python SDK, C# SDK 또는 JavaScript/TypeScript SDK를 사용하여 각 작업을 완료했습니다.

다음 단계

평가 워크플로를 계속 개선합니다.