Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Hodnocení agenta by mělo být iterativní proces, začínající fází vizualizace a návrhu agenta, pokračující nasazením agenta a detekcí regrese. Tato šablona poskytuje základní prvky pro tvorbu testovacích sad hodnocení a jak implementovat a iterovat čtyřfázovou strukturu během životního cyklu agenta.
- Fáze 1: Vytvořit základní hodnotící testovací sady
- Fáze 2: Vytvoření směrného plánu a zlepšení
- Fáze 3: Implementace systematického rozšíření
- Fáze 4: Zavést kontinuální hodnocení kvality
Tip
Fáze 1: Vytvořit základní hodnotící testovací sady
Cíl: Vytvořit a spustit základní hodnotící testovací sadu, která hodnotí klíčové scénáře agenta.
Hodnotící testovací sada je skupina testovacích případů. Testovací případ je dvojice výzva a odpověď, která individuálně hodnotí odpověď agenta na konkrétní otázku. Obsahuje testovací výzvu a volitelnou očekávanou odpověď (prověřovací tvrzení), která přímo vychází z požadavku na pokyny agenta. Testovací případ by měl také specifikovat kritéria přijetí a testovací metodu pro hodnocení kvality.
| Scénář agenta1 | Zadání na test (Ukázkový prompt s otázkou pro agenta) |
Očekávaná odpověď | Kritéria přijetí2 (Definujte, jak vypadá úspěšná odpověď: Co projde a co ne) |
|---|---|---|---|
| Agent by měl odpovídat na obsah politiky na základě článku o znalostech politiky. | "Kolik dní nemocenské dostane zaměstnanec?" | "30 dní. <citace>" | Odpověď musí obsahovat přesný text ze znalosti zásad a shody textu. Odpověď musí obsahovat citaci. |
| Agent by neměl odpovídat na otázky nad rámec článku o znalostech politiky. Přímé odpovědi na lidskou podporu personalistiky. | "Kolik dní nemocenské dostane zaměstnanec?" | "Dokument s politikou nespecifikuje dny nemocenské. Konzultujte HR ohledně své nemocenské politiky." | Odpověď na zakázaný případ musí být přesměrována na lidskou podporu personalistiky. |
Tip
1Scénář agenta: Základní testovací sada by měla zahrnovat testovací případy pokrývající klíčové scénáře nebo případy použití agenta. Použijte scénář s agentem jako vodítko a zaměřte se na to, co má agent řešit nebo čemu se má vyhnout. Tento proces vám pomáhá sestavit cílený seznam testovacích promptů a měl by být úzce koordinován s vývojem instrukcí pro agenta. Pro určení správného počtu testovacích případů začněte jedním testovacím promptem pro každý klíčový scénář. Začněte s malou sadou testovacích případů, poté postupně iterujte a zdokonalujte informace, jak získáváte poznatky a zlepšujete pokrytí.
2Kritéria přijetí: Jasně definovat, co znamená úspěch. Tato definice může být zpočátku náročná, proto zvažte zpřesnění kritérií prostřednictvím iterace. Spusť testovací výzvu, zkontroluj odpověď a zhodnoťte její kvalitu otázkou: Odpovídá na hlavní otázku? Používá správné informace? Je tón a styl vhodný? Respektuje to oprávnění ke sdílení? Vaše poznatky z těchto otázek vám pomáhají stanovit kritéria přijetí a v případě potřeby i očekávanou odpověď.
Fáze 2: Stanovte si základní úroveň a zlepšujte se
Cíl: Provést hodnocení a stanovit základní metriky pro benchmarking a zlepšení.
Můžete provádět hodnocení ručně nebo použít specializované nástroje. Pro manuální hodnocení pošlete testovací prompt agentovi, zkontrolujte odpověď, použijte lidský úsudek k určení, zda splňuje kritéria přijetí, a zaznamenejte výsledek. Microsoft nabízí nástroje pro vyhodnocení agenta, včetně funkce vyhodnocení agenta Copilot Studio.
Stanovte základní linii
- Spusťte základní testovací sadu proti agentovi.
- U každého testovacího případu zdokumentujte, zda byl úspěšný nebo neúspěšný.
- Spočítejte celkovou úspěšnost: ______%.
- Zaznamenejte verzi agenta a výchozí datum: ___________.
Analýza a iterace příčiny
Prohlédněte si výsledky hodnocení, abyste identifikovali falešně pozitivní a skutečně negativní pro další analýzu. Falešně pozitivní výsledek je odpověď označená jako úspěšná, ale měla by selhat na základě lidského úsudku. Pravé negativní je odpověď správně identifikovaná jako neúspěch. Zhodnoťte neúspěšné případy ze dvou úhlů pohledu:
- Problém v testovacím případě: Způsobuje neúspěch testovací úkol, očekávaná forma odpovědi nebo kritéria akceptace?
- Problém s návrhem agenta: Naznačuje selhání nejasné pokyny agenta, nebo chyby ve znalostech či konfiguraci nástrojů?
Identifikujte příčinu a zlepšite ji buď vylepšením testovacího případu, nebo zlepšením návrhu agenta.
Tip
Hodnocení úspěšného hodnocení: Agenti mohou na stejnou výzvu reagovat různě kvůli své pravděpodobnostní povaze. Tato variabilita může způsobit, že odpovědi budou úspěšné nebo neúspěšné v závislosti na přísnosti kritérií přijetí. Pro zajištění spolehlivého hodnocení spusťte každou testovací sadu několikrát a vypočítejte průměrnou úspěšnost. Snažte se dosáhnout realistické úspěšnosti 80-90%, podle potřeb vašeho podnikání.
Fáze 3: Implementace systematického rozšiřování
Cíl: Vytvořit komplexní hodnotící sady pro různé kategorie kvality agentů.
Fáze 1 a 2 stanovily základní testovací sadu pro primární případy použití agenta. Dále rozšiřte své hodnocení vytvořením testovacích sad, které hodnotí různé kategorie kvality agentů. Následující seznam naznačuje kategorie, které se zabývají různými aspekty kvality.
| Kategorie kvality | Goal |
|---|---|
| Základní jádro | Sada „musí projít“. Měří základní kvalitu odezvy při nasazení a provádí regresní detekci během provozu. |
| Odolnost agenta | Základní hodnotou jednoho agenta oproti tradičnímu softwaru je jeho robustnost při řešení různých případů použití. Tato hodnota může zahrnovat:
|
| Test architektury | Zhodnoťte funkční výkon agenta. Rozměry mohou zahrnovat:
|
| Okrajové případy | Jak by měl agent řešit okrajové případy s mantinely.
|
Tip
Odkaz na účel kategorie:
- Jádro selže: Něco je rozbité nebo nefunguje. Prozkoumejte nedávné změny.
- Robustnost selhává: Agent je příliš přísný. Může být příliš zaměřený na konkrétní formulace.
- Selhání architektury: Konkrétní komponenta nebo pracovní postup je třeba ladit.
- Selhání okrajových případů: Mantinely potřebují zlepšení. Posilujte hranice.
Fáze 4: Zavést kontinuální hodnocení kvality
Cíl: Zavést kontinuální evaluační monitorování pro udržení kvality agentů během provozu.
Jakmile nasadíte agenta do produkce, vstupuje do stabilní fáze. Pro udržení kvality a rychlé odhalení regresi nebo problémů způsobených změnami produktu (například modernizace modelů nebo aktualizací znalostního systému) či vyvíjejícími se případy použití, nastavte průběžnou evaluační operaci. Naplánujte pravidelné vyšetření, nebo je spouštějte na základě konkrétních událostí pro zajištění kvality.
- Zavedte pravidelný kontrolní rytmus hodnocení.
- Navrhované spouštěče kompletního hodnocení sady:
- Změna modelu
- Aktualizace zásadního nastavení znalostí
- Nové integrace nástrojů nebo konektorů
- Incident s produkcí
Tip
Ukazatel úspěchu: Úspěšně operacionalizujete, když dokážete odpovědět na obavy zainteresovaných stran konkrétními informacemi, místo abyste řekli: "Agent se zdá být v pořádku."
Říkáte: "Shoda s pravidly je na 98%, ale personalizace klesla na 87%— konkrétně politiky založené na délce pracovního poměru nejsou aplikovány. Identifikovali jsme příčinu a iterujeme."