Rychlý úvod: Vyhodnocení svého hostovaného agenta

Note

Prostředí pro vyhodnocení rozhraní příkazového řádku pro vývojáře Azure je aktuálně ve verzi Preview.

V tomto rychlém startu vyhodnotíte hostovaného agenta, který jste nasadili v nasazení prvního hostovaného agenta. Zadáte testovací datovou sadu, zvolíte vyhodnocovače, spustíte vyhodnocení s nasazeným agentem a zkontrolujete skóre. Každý krok ukazuje pět způsobů, jak provést stejnou úlohu: rozhraní příkazového řádku pro vývojáře Azure (azd), portál Microsoft Foundry, sadu Python SDK, sadu SDK jazyka C# a sadu JavaScript/TypeScript SDK.

Vyhodnocení stanoví výchozí úroveň kvality vašeho agenta a umožní vám nastavit akceptační prahy, například míru úspěšného splnění požadavků úlohy, ještě než změny zpřístupníte uživatelům.

Předpoklady

Než začnete, potřebujete:

  • Nasazený, vyvolatelný hostovaný agent z Nasazení prvního hostovaného agenta. Pro postup s Azure Developer CLI také potřebujete adresář projektu azd, který jste vytvořili v tomto rychlém startu.

  • Role Uživatele Foundry u prostředku Foundry.

  • Nasazení modelu dokončení chatu ve stejném projektu Foundry, které se použije jako model soudce, který bude hodnotit odpovědi. Nasazení modelu, které už agent používá, můžete znovu použít, včetně toho z předchozího rychlého startu, takže nepotřebujete samostatné nasazení.

    Důležité

    Nedávno byly přejmenovány role Foundry RBAC. Foundry User, Foundry Owner, Foundry Account Owner a Foundry Project Manager se dříve nazývaly Uživatel Azure AI, Vlastník Azure AI, Vlastník účtu Azure AI a Správce projektů Azure AI. Během zavádění přejmenování se stále můžou zobrazovat předchozí názvy na některých místech. ID rolí a základní oprávnění se při přejmenování nezmění.

Každý krok nabízí pět cest. Použijte podle toho, co dáváte přednost:

  • Azure CLI pro vývojáře: rozšíření azd ai agent (azure.ai.agents), verze 0.1.40-preview nebo novější, které poskytuje příkazy azd ai agent eval. Toto rozšíření je součástí microsoft.foundry rozšíření, které jste nainstalovali v předchozím rychlém startu. Ověřte nainstalovanou verzi pomocí azd ext listpříkazu a v případě potřeby spusťte azd ext upgrade microsoft.foundry . Přihlaste se pomocí azd auth login.
  • Portál Foundry: Přístup k portálu Foundry.
  • Python SDK: Python 3.10 nebo novější a Azure CLI přihlášené pomocí az login, aby se DefaultAzureCredential mohlo ověřit. Informace o instalaci najdete v tématu Instalace Azure CLI.
  • C# SDK: .NET 10 SDK nebo novější a Azure CLI přihlášené pomocí az login, aby se DefaultAzureCredential mohlo ověřit.
  • JavaScript/TypeScript SDK: Node.js 20 LTS nebo novější a Azure CLI přihlášené pomocí az login, aby se DefaultAzureCredential mohla ověřit.

Krok 1: Potvrzení nasazeného agenta

Vyhodnocení probíhá vůči nasazenému agentovi, kterého lze vyvolat. Před nastavením vyhodnocení ověřte, že je váš agent nasazený a dostupný.

Ve vašem azd adresáři projektu ověřte, že je agent nasazený a lze ho spustit:

azd ai agent show

Odeslat testovací výzvu:

azd ai agent invoke "Write a haiku about deploying cloud applications."

Během několika sekund by se měla zobrazit odpověď.

Krok 2: Nastavení integrovaných vyhodnocovačů

Začněte s integrovanými vyhodnocovači, které vyhodnotí agenta proti testovací datové sadě.

Nejprve vytvořte soubor JSONL s testovacími dotazy pro vašeho agenta. Každý řádek je objekt JSON s polem query . Uložte ho do zdrojové složky vašeho agenta jako src/<your-agent-name>/tests/queries.jsonl:

{"query": "Write a haiku about deploying cloud applications."}

Potom vytvořte eval.yaml soubor ve stejné zdrojové složce agenta jako src/<your-agent-name>/eval.yaml. Odkazuje na vaši datovou sadu a zobrazí seznam předdefinovaných vyhodnocovačů, které se mají použít. Cesta dataset.local_uri je relativní k této složce. Nahraďte <your-agent-name> názvem hostovaného agenta a <your-chat-completion-deployment> nasazením modelu soudce:

name: agent-eval
agent:
  name: <your-agent-name>
  kind: hosted
dataset:
  local_uri: tests/queries.jsonl
evaluators:
  - builtin.intent_resolution
  - builtin.task_adherence
options:
  eval_model: <your-chat-completion-deployment>
max_samples: 15

Hodnota eval_model je hodnoticí model, který hodnotí odpovědi; můžete znovu použít nasazení, které už váš agent používá.

Krok 3: Spuštění vyhodnocení

Spusťte sadu testů vůči vašemu nasazenému agentovi. Služba odešle každý testovací dotaz agentovi, zachytí odpověď a ohodnotí ji pomocí vámi vybraných evaluátorů.

Note

Vyhodnocování založené na cíli přímo spouští vašeho hostovaného agenta. Funguje s agenty, kteří používají protokol odpovědí nebo vyvolání s synchronním spouštěním bez streamování. Pokud chcete vyhodnotit agenty, kteří používají protokol A2A nebo protokol Activity, případně jiné vzorce provádění, například dlouhotrvající běhy nebo streamování, vyhodnocujte místo toho trasovací záznamy, které váš agent generuje. Viz vyhodnocení trasování.

Spusťte vyhodnocení z kořenového adresáře pracovního prostoru azd:

azd ai agent eval run --config eval.yaml

Note

azd ai agent eval run vyhodnotí cestu --config relativně ke zdrojové složce vašeho agenta v rámci src/ (například src/<your-agent-name>/eval.yaml), nikoli k aktuálnímu adresáři. V této složce ponechte eval.yamla datovou sadu, na kterou odkazuje local_uri .

Příkaz přečte eval.yaml, odešle každý dotaz vašemu agentovi, ohodnotí odpovědi a po dokončení vypíše shrnutí:

Eval run started
   Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
   Run:  evalrun_5f72ef189ad24790a32128e6f230b131
   (✓) Done  Eval run

Results:    1 total, 1 passed, 0 failed, 0 errored

Per-criteria results:
  intent_resolution: 1 passed, 0 failed, 0 errored
  task_adherence: 1 passed, 0 failed, 0 errored

Krok 4: Kontrola výsledků

Vyhodnocení se obvykle dokončí během několika minut v závislosti na počtu dotazů.

Výpis nedávných vyhodnocení:

azd ai agent eval list
    Eval ID                                Name        Status of last run  Runs
    -------                                ----        ------------------  ----
*   eval_b36748dede424e4ba3f8e6c99ca2cf27  agent-eval  Completed           1

* = active eval in current environment

Zobrazte nejnovější hodnocení a jeho běhy:

azd ai agent eval show
Eval:   eval_b36748dede424e4ba3f8e6c99ca2cf27
Name:   agent-eval
Agent:  <your-agent-name>
Runs:   1

Recent runs:
  Run ID                                    Status     Passed  Failed  Created
  ------                                    ------     ------  ------  -------
  evalrun_5f72ef189ad24790a32128e6f230b131  Completed  1/1     0       2026-06-17 14:52 UTC

Pomocí výsledků potvrďte, která verze agenta byla vyhodnocena a jaká skóre vyhodnocovače byla vygenerována. Chcete-li zobrazit podrobnosti pro jednotlivé vyhodnocovače a odkaz na sestavu v portálu Foundry, spusťte azd ai agent eval show <eval-id> --eval-run-id <run-id>.

Vyčistěte zdroje

Tento rychlý start zaregistruje datovou sadu, vyhodnocení a historii spuštění v projektu Foundry. Tato aktiva jsou spojena s minimálními nebo nulovými průběžnými náklady.

Pokud chcete odebrat hostovaného agenta a prostředky Azure, které jste vytvořili, postupujte podle kroků čištění v části Nasazení prvního hostovaného agenta.

Řešení problémů

Issue Solution
Příkaz azd ai agent eval se nenašel Spusťte azd ext list a ověřte, že rozšíření azd ai agent má verzi 0.1.40-preview nebo novější. Aktualizujte pomocí azd ext upgrade microsoft.foundry.
azd ai agent eval run Nedaří se najít agenta Ověřte, že je agent nasazen a že ho lze spustit pomocí příkazu azd ai agent show. V případě potřeby znovu nasaďte azd deploy .
ModuleNotFoundError pro azure.ai.projects nebo azure.identity Nainstalujte sadu SDK: pip install "azure-ai-projects>=2.0.0" azure-identity.
C#: The type or namespace name 'Evals' (or 'AIProjectClient') could not be found Přidejte balíčky: dotnet add package Azure.AI.Projects --prerelease, dotnet add package OpenAIa dotnet add package Azure.Identity.
AuthenticationError, DefaultAzureCredential nebo Forbidden selhání Přihlaste se pomocí az login (nebo azd auth login pro cestu rozhraní příkazového řádku) a potvrďte, že máte v projektu roli Uživatele Foundry . Nahrávání datových sad také vyžaduje přístup k zápisu do úložiště projektu.
Cíl agenta nebyl nalezen. Ověřte název a verzi agenta pomocí project_client.agents.get("<your-agent-name>") příkazu nebo project_client.agents.list().
Mnoho chybovaných řádků nebo neočekávaně nízké skóre Otevřete URL sestavy a zkontrolujte, zda u některých řádků došlo k chybám v odpovědi agenta nebo vyhodnocovače. Opravte související chyby a pak znovu spusťte vyhodnocení.
Nasazení vyhodnocovacího modelu nebylo nalezeno. Ověřte, že ve vašem projektu v části FOUNDRY_MODEL_NAMEeval_modeleval.yaml existuje nasazení hodnoticího modelu ( pro sadu SDK nebo > v ).

Co jste se naučili

V tomto rychlém průvodci vám:

  • Vytvořili jste testovací datovou sadu a zvolili vyhodnocovače pro hostovaného agenta.
  • Spustili jste vyhodnocení nasazeného agenta.
  • Zkontrolujte agregované výsledky a výsledky na úrovni řádků.
  • Každou úlohu jste dokončili pomocí rozhraní příkazového řádku pro vývojáře Azure, portálu Foundry, sady Python SDK, sady C# SDK nebo sady JavaScript/TypeScript SDK.

Další kroky

Pokračujte v vylepšování pracovního postupu vyhodnocení: