Hızlı Başlangıç: Barındırılan aracınızı değerlendirme

Note

Azure Geliştirici CLI değerlendirme deneyimi şu anda önizleme aşamasındadır.

Bu hızlı başlangıçta, İlk barındırılan aracınızı dağıtma bölümünde dağıttığınız barındırılan aracıyı değerlendireceksiniz. Bir test veri kümesi sağlar, değerlendiricileri seçer, dağıtılan aracıya karşı bir değerlendirme çalıştırır ve puanları gözden geçirirsiniz. Her adımda aynı görevi gerçekleştirmenin beş yolu gösterilir: Azure Geliştirici CLI'si (azd), Microsoft Foundry portalı, Python SDK'sı, C# SDK'sı ve JavaScript/TypeScript SDK'sı.

Değerlendirme, aracınız için bir kalite temeli oluşturur ve kullanıcılara değişiklik yayınlamadan önce görev bağlılık geçirme oranı gibi kabul eşiklerini ayarlamanıza olanak tanır.

Prerequisites

Başlamadan önce şunları yapmanız gerekir:

  • İlk barındırılan aracınızı dağıtın bölümündeki dağıtılmış, çağrılabilir bir barındırılan aracı. Azure Geliştirici CLI yolu için, bu hızlı başlangıçta oluşturduğunuz proje dizinine de ihtiyacınız vardırazd.

  • Foundry kaynağındaki Foundry User rolü.

  • Yanıtları puanlayan yargıç modeli olarak kullanılacak aynı Dökümhane projesinde bir sohbet tamamlama modeli dağıtımı. Aracınızın önceki hızlı başlangıçtaki dağıtım dahil olmak üzere zaten kullandığı model dağıtımını yeniden kullanabilirsiniz, böylece ayrı bir dağıtıma ihtiyacınız olmaz.

    Important

    Foundry RBAC rolleri yakın zamanda yeniden adlandırıldı. Foundry User, Foundry Owner, Foundry Hesabı Sahibi ve Foundry Project Manager daha önce Azure Yapay Zeka Kullanıcısı, Azure Yapay Zeka Sahibi, Azure Yapay Zeka Hesabı Sahibi ve Azure Yapay Zeka Project Yöneticisi olarak adlandırıldı. Yeniden adlandırma kullanıma sunulmaya devam ederken bazı yerlerde önceki adları görmeye devam edebilirsiniz. Rol kimlikleri ve temel izinler yeniden adlandırma ile değiştirilmez.

Her adım beş yol sunar. Hangisini tercih ederseniz onu kullanın:

  • Azure Geliştirici CLI'sı: azd ai agent Komutları sağlayan azure.ai.agents uzantı (azd ai agent eval), sürüm 0.1.40-preview veya üzeri. Bu uzantı, önceki hızlı başlangıçta yüklediğiniz uzantıya dahildir microsoft.foundry . Yüklü sürümü azd ext list ile doğrulayın ve gerekirse azd ext upgrade microsoft.foundry çalıştırın. azd auth login ile oturum açın.
  • Dökümhane portalı: Dökümhane portalına erişim.
  • Python SDK: Python 3.10 veya üzeri ve az login kimlik doğrulaması yapabilsin diye, DefaultAzureCredential ile Azure CLI'da oturum açılmış olması gerekir. Yükleme için bkz . Azure CLI'yi yükleme.
  • C# SDK: .NET 10 SDK veya sonrası ve az login’ün kimlik doğrulaması yapabilmesi için DefaultAzureCredential ile oturum açılmış Azure CLI.
  • JavaScript/TypeScript SDK'sı: Node.js 20 LTS veya üzeri ve Azure CLI ile az login oturum açın; böylece DefaultAzureCredential kimlik doğrulaması yapılabilir.

1. Adım: Dağıtılan aracınızı onaylayın

Değerlendirme, dağıtılmış ve çağrılabilir bir ajana karşı çalıştırılır. Değerlendirmeyi yapılandırmadan önce aracınızın dağıtıldığını ve kullanıma hazır olduğunu doğrulayın.

Proje dizininizden azd aracının dağıtıldığından ve çağrılanabildiğinden emin olun:

azd ai agent show

Bir test istemi gönderin:

azd ai agent invoke "Write a haiku about deploying cloud applications."

Birkaç saniye içinde bir yanıt görmeniz gerekir.

2. Adım: Yerleşik değerlendiricileri ayarlama

Ajanınızı bir test veri kümesine karşı puanlamak için yerleşik değerlendiricilerle başlayın.

İlk olarak, aracınız için test sorgularından oluşan bir JSONL dosyası oluşturun. Her satır, alanı olan bir query JSON nesnesidir. Ajanınızın kaynak klasörüne, src/<your-agent-name>/tests/queries.jsonl olarak kaydedin:

{"query": "Write a haiku about deploying cloud applications."}

Ardından, eval.yamlile aynı aracı kaynak klasöründe bir src/<your-agent-name>/eval.yaml dosya oluşturun. Veri kümenize işaret eder ve uygulanacak yerleşik değerlendiricileri listeler. dataset.local_uri yolu bu klasöre görelidir. <your-agent-name> öğesini barındırılan aracınızın adıyla ve <your-chat-completion-deployment> öğesini yargıç modeli dağıtımıyla değiştirin:

name: agent-eval
agent:
  name: <your-agent-name>
  kind: hosted
dataset:
  local_uri: tests/queries.jsonl
evaluators:
  - builtin.intent_resolution
  - builtin.task_adherence
options:
  eval_model: <your-chat-completion-deployment>
max_samples: 15

eval_model değeri, yanıtları puanlayan yargıç modelidir; aracınızın zaten kullandığı dağıtımı yeniden kullanabilirsiniz.

3. Adım: Değerlendirmeyi çalıştırma

Test paketini dağıtıma alınmış aracınıza karşı çalıştırın. Hizmet her test sorgusunu aracıya gönderir, yanıtı yakalar ve seçtiğiniz değerlendiricilerle puanlar.

Note

Hedef tabanlı değerlendirme, barındırılan aracınızı doğrudan çağırır. Yanıtlar veya çağrılar protokolünü eşzamanlı, akışsız çalıştırmayla kullanan aracılarla çalışır. A2A veya Activity protokolünü ya da uzun süreli çalışma veya akış gibi diğer yürütme kalıplarını kullanan ajanları değerlendirmek için, bunun yerine ajanınızın oluşturduğu izleri değerlendirin. Bkz. İzleme değerlendirmesi.

Değerlendirmeyi azd çalışma alanı kökünden çalıştırın:

azd ai agent eval run --config eval.yaml

Note

azd ai agent eval run, yolu geçerli dizine göre değil, --config altındaki aracınızın kaynak klasörüne göre çözümler (örneğin, src/). eval.yaml öğesini ve local_uri’in işaret ettiği veri kümesini o klasörün içinde tutun.

komutu okur eval.yaml, her sorguyu aracınıza gönderir, yanıtları puanlar ve tamamlandığında bir özet yazdırır:

Eval run started
   Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
   Run:  evalrun_5f72ef189ad24790a32128e6f230b131
   (✓) Done  Eval run

Results:    1 total, 1 passed, 0 failed, 0 errored

Per-criteria results:
  intent_resolution: 1 passed, 0 failed, 0 errored
  task_adherence: 1 passed, 0 failed, 0 errored

4. Adım: Sonuçları gözden geçirme

Değerlendirmeler genellikle sorgu sayısına bağlı olarak birkaç dakika içinde tamamlar.

Son değerlendirmeleri listeleyin:

azd ai agent eval list
    Eval ID                                Name        Status of last run  Runs
    -------                                ----        ------------------  ----
*   eval_b36748dede424e4ba3f8e6c99ca2cf27  agent-eval  Completed           1

* = active eval in current environment

En son değerlendirmeyi ve buna ait çalıştırmaları gösterin:

azd ai agent eval show
Eval:   eval_b36748dede424e4ba3f8e6c99ca2cf27
Name:   agent-eval
Agent:  <your-agent-name>
Runs:   1

Recent runs:
  Run ID                                    Status     Passed  Failed  Created
  ------                                    ------     ------  ------  -------
  evalrun_5f72ef189ad24790a32128e6f230b131  Completed  1/1     0       2026-06-17 14:52 UTC

Hangi aracı sürümünün değerlendirildiğini ve hangi değerlendirici puanlarının üretildiğini onaylamak için sonuçları kullanın. Değerlendirici başına ayrıntıları ve Foundry portalındaki rapor bağlantısını görmek için azd ai agent eval show <eval-id> --eval-run-id <run-id> komutunu çalıştırın.

Kaynakları temizle

Bu hızlı başlangıçta Foundry projenize bir veri kümesi, değerlendirme ve çalıştırma geçmişi kaydedilmektedir. Bu varlıklar çok az maliyetlidir veya devam eden bir maliyet doğurmaz.

Barındırılan aracıyı ve oluşturduğunuz Azure kaynaklarını kaldırmak için, İlk barındırılan aracınızı dağıtma bölümündeki temizleme adımlarını izleyin.

Troubleshooting

Issue Çözüm
azd ai agent eval komutu bulunamadı azd ext list komutunu çalıştırın ve azd ai agent uzantısının 0.1.40-preview veya daha sonraki bir sürüm olduğunu doğrulayın. azd ext upgrade microsoft.foundry ile yükseltin.
azd ai agent eval run aracı bulunamadı Aracının azd ai agent show ile dağıtıldığını ve çağrılabildiğini onaylayın. Gerekirse azd deploy ile yeniden dağıtın.
ModuleNotFoundError, azure.ai.projects veya azure.identity için SDK'yi yükleyin: pip install "azure-ai-projects>=2.0.0" azure-identity.
C#: The type or namespace name 'Evals' (or 'AIProjectClient') could not be found Paketleri ekleyin: dotnet add package Azure.AI.Projects --prerelease, dotnet add package OpenAIve dotnet add package Azure.Identity.
AuthenticationError, DefaultAzureCredentialveya Forbidden hatası az login ile oturum açın (veya CLI yolu için azd auth login ile) ve projede Foundry User rolüne sahip olduğunuzu doğrulayın. Veri kümesi yüklenmesi için projenin depolama alanına yazma erişimi de gereklidir.
Ajan hedefi bulunamadı veya project_client.agents.get("<your-agent-name>")ile project_client.agents.list() aracı adını ve sürümünü doğrulayın.
Birçok hatalı satır veya beklenmedik şekilde düşük puanlar Rapor URL'sini açın ve satırların aracı yanıtı veya değerlendirici hatalarıyla başarısız olup olmadığını denetleyin. Temelindeki hataları düzeltin, ardından değerlendirmeyi yeniden çalıştırın.
Değerlendirme modeli dağıtımı bulunamadı Projenizde FOUNDRY_MODEL_NAMEeval_modeleval.yaml altında yargıç modeli dağıtımının (SDK için veya > içinde) mevcut olduğunu doğrulayın.

Öğrendiklerin

Bu hızlı başlangıç rehberinde şunları yapacaksınız:

  • Bir test veri kümesi oluşturdunuz ve barındırılan aracınız için değerlendiricileri seçtiniz.
  • Dağıtılan aracı üzerinde bir değerlendirme yapıldı.
  • Toplanan ve satır düzeyi sonuçlar gözden geçirildi.
  • her görevi Azure Geliştirici CLI'si, Döküm portalı, Python SDK'sı, C# SDK'sı veya JavaScript/TypeScript SDK'sı ile tamamladık.

Sonraki Adımlar

Değerlendirme iş akışınızı geliştirmeye devam edin: