Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Note
Funkce v tomto článku jsou poháněny standardním kabelem, který využívá fakturační možnosti popsané v sekci Licencování pro agenty poháněné standardním kabelem. Naučte se, jak získat přístup ke standardním funkcím v části Přístup ke standardním agentům a tokům agentů.
Jak agenti AI přebírají klíčové role v obchodních procesech, stává se potřeba spolehlivého a opakovatelného testování nezbytná. Hodnocení agentů vám umožní generovat testy , které simulují reálné scénáře pro vašeho agenta. Tyto testy pokrývají více otázek a konverzací rychleji než ruční testování případ od případu. Pak můžete změřit přesnost, levnost a kvalitu odpovědí interakcí vašeho agenta na základě informací, ke které má agent přístup. Použitím výsledků z testovací sady můžete optimalizovat chování svého agenta a ověřit, že splňuje požadavky na vaše podnikání a kvalitu.
Proč používat automatizované testování?
Hodnocení agentů poskytuje automatizované, strukturované testování. Pomáhá to včas odhalit problémy, snižuje riziko špatných odpovědí a udržuje kvalitu, jak se agent vyvíjí. Tento proces přináší automatizovanou, opakovatelnou formu zajištění kvality do testování agentů. Zajišťuje, že agent splňuje standardy přesnosti a spolehlivosti vaší firmy a poskytuje transparentnost způsobu jeho výkonu. Má jiné silné stránky než testování pomocí testovacího chatu.
Vyhodnocení spustíte a výsledky zobrazíte pomocí rozhraní Copilot Studio prostřednictvím rozhraní REST API Power Platform nebo přidáním akcí v nástrojích, tocích nebo Power Automate.
Hodnocení agentů měří správnost a výkon, nikoli problémy s etikou nebo bezpečností AI. Agent může projít všemi hodnotícími testy, ale přesto například odpoví nevhodně na otázku. Zákazníci by stále měli používat zodpovědné revize umělé inteligence a bezpečnostní filtry obsahu; hodnocení nenahrazují tyto revize a filtry.
Omezení vládního komunitního cloudu
Hodnocení agentů v prostředí Government Community Cloud (GCC) má následující omezení:
Výrobci nemohou přidat uživatelský profil do svých testovacích sad. Výrobci však mohou stále provádět hodnocení i bez uživatelského profilu.
Výrobci nemohou použít metodu testu podobnosti pro hodnocení. Všechny ostatní testovací metody jsou k dispozici.
Jak funguje hodnocení agentů
Copilot Studio používá pro každé vyhodnocení agenta testovací případ. Testovací případ je jedna interakce, která simuluje způsob interakce uživatele s vaším agentem. Interakce může být jedna otázka nebo celá konverzace.
Testovací případ může také obsahovat odpověď, kterou očekáváte , že vám agent odpoví. Příklady:
Otázka: Jaké máte pracovní hodiny?
Očekávaná odpověď: Jsme otevřeni od 9:00 do 17:00, pondělí až pátek.
Pomocí vyhodnocení agentů můžete generovat, importovat nebo ručně napsat skupinu testovacích případů. Tato skupina testovacích případů se nazývá testovací sada. Testovací sada vám umožňuje:
Spusť více testovacích případů, které pokrývají širokou škálu schopností najednou, místo toho, abys se svého agenta ptal na jednu otázku po druhé.
Analyzujte výkon svého agenta pomocí snadno stravitelného souhrnného skóre a také se zaměřte na jednotlivé testovací případy.
Testujte změny u svých agentů pomocí stejné testovací sady, abyste měli objektivní standard pro měření a porovnání změn ve výkonu.
Rychle vytvořte nové testovací sady nebo upravte stávající tak, aby pokrývaly měnící se schopnosti nebo požadavky agentů.
Každá testovací sada může vyhodnotit vašeho agenta pomocí více testovacích metod najednou.
Můžete také zvolit profil uživatele, který bude fungovat jako stimulovaný uživatel. Agent může být nakonfigurován tak, aby reagoval na různé uživatele různými způsoby, nebo umožňoval přístup ke zdrojům různými způsoby.
Když vyberete testovací sadu a spustíte vyhodnocení agenta, Copilot Studio odešle otázky v testovacích případech, zaznamená odpovědi agenta, porovná tyto odpovědi s očekávanými odpověďmi nebo standardní kvalitou a přiřadí skóre každému testovacímu případu. Můžete také vidět detaily, přepis a mapu aktivit pro každý testovací případ a jaké zdroje váš agent použil k vytvoření odpovědi.
Vytvoření komplexní strategie hodnocení
Před spuštěním vyhodnocení definujte, jak vypadá úspěch vašeho agenta, a rozhodněte se, které scénáře jsou pro vaše obchodní výsledky nejdůležitější. Jasná strategie vám pomůže zvolit správné testovací metody, určit prioritu vysoce ovlivněných testovacích případů a interpretovat výsledky se správným kontextem.
Použijte téma Návrh řešení agentů: Rámce hodnocení pro mapování obchodních cílů do měřitelných dimenzí hodnocení a přístupů vytváření skóre.
Pomocí navrhování a zprovoznění vyhodnocení agenta lze vytvořit proces opakovaného vyhodnocení, který podporuje neustálé vylepšování kvality.
Integrace vyhodnocení do automatizovaných toků
Vyhodnocení agenta podporuje automatizaci, aby tvůrci mohli spouštět hodnocení bez ručního zásahu. Pomocí rozhraní REST API nebo konektorů Power Platform můžete programově aktivovat spuštění vyhodnocení a integrovat testování do automatizovaných pracovních postupů, jako jsou kanály kontinuální integrace a průběžného nasazování (CI/CD). Tento přístup umožňuje spouštět testovací sady ve velkém měřítku a ověřovat chování agenta při zavádění změn bez nutnosti ručního spuštění v Copilot Studio.
Testovací chat versus hodnocení agentem
Každá metoda testování vám poskytne odlišný vhled do vlastností a chování vašeho agenta:
Přijímá a odpovídá na jednu otázku najednou. Je těžké opakovat stejné testy opakovaně.
Umožňuje vám otestovat celou relaci obsahující více zpráv.
Umožňuje vám komunikovat s vaším agentem jako uživatelem pomocí chatovacího rozhraní.
Hodnocení agenta:
Pomocí testovací sady můžete vytvořit a spustit více testovacích případů najednou. Testy můžete opakovat testováním se stejnou testovací sadou.
Může testovat jednu otázku a jednu odpověď na testovací případ nebo jednu konverzaci na testovací případ. Nicméně máte menší kontrolu nad konverzacemi než při použití testovacího chatu.
Vyberte různé uživatelské profily, abyste simulovali různé uživatele, aniž byste museli sami provádět interakce.
Když testujete agenta, použijte jak testovací chat, tak hodnocení agenta, abyste získali úplný obraz o agentovi.
Jazyková podpora při hodnocení agenta
Agenti v Copilot Studio podporují více jazyků. Pokud nakonfigurujete svého agenta tak, aby podporoval více jazyků, můžete si pro konkrétní hodnocení vybrat jazyk, který chcete.
U vícejazyčného agenta mají následující hodnotící komponenty specifické chování:
Generování dotazů
Výchozí jazyk je jazyk, který nejčastěji používáte při zadávání hodnotících vstupů. Vyberte jazyk, ve kterém chcete hodnocení spustit. Když spustíte více vyhodnocení, výstup je ve stejném jazyce jako vstup.
Spuštění hodnoticího nástroje
Při hodnocení vícejazyčného agenta metoda porovnání významu porovnává očekávanou odpověď s odpovědí agenta. Pokud nastane problém týkající se více jazyků, systém detekuje nesoulad, hodnotitel porovnání významu označí odpověď jako neúspěšnou a odpověď je označena jako neúspěšná kvůli jazykové nekonzistenci.
Vysvětlovací výstup
Ve vícekolových konverzacích s vícejazyčným agentem agent uvádí své odůvodnění ve stejném jazyce, jaký používá ve svých odpovědích.
Limitations
Vyhodnocování agenta v současné době nepodporuje datové agenty Fabric.