O hodnocení agentů

Note

Funkce v tomto článku jsou poháněny standardním kabelem, který využívá fakturační možnosti popsané v sekci Licencování pro agenty poháněné standardním kabelem. Naučte se, jak získat přístup ke standardním funkcím v části Přístup ke standardním agentům a tokům agentů.

Jak agenti AI přebírají klíčové role v obchodních procesech, stává se potřeba spolehlivého a opakovatelného testování nezbytná. Hodnocení agentů vám umožní generovat testy , které simulují reálné scénáře pro vašeho agenta. Tyto testy pokrývají více otázek a konverzací rychleji než ruční testování případ od případu. Pak můžete změřit přesnost, levnost a kvalitu odpovědí interakcí vašeho agenta na základě informací, ke které má agent přístup. Použitím výsledků z testovací sady můžete optimalizovat chování svého agenta a ověřit, že splňuje požadavky na vaše podnikání a kvalitu.

Proč používat automatizované testování?

Hodnocení agentů poskytuje automatizované, strukturované testování. Pomáhá to včas odhalit problémy, snižuje riziko špatných odpovědí a udržuje kvalitu, jak se agent vyvíjí. Tento proces přináší automatizovanou, opakovatelnou formu zajištění kvality do testování agentů. Zajišťuje, že agent splňuje standardy přesnosti a spolehlivosti vaší firmy a poskytuje transparentnost způsobu jeho výkonu. Má jiné silné stránky než testování pomocí testovacího chatu.

Vyhodnocení spustíte a výsledky zobrazíte pomocí rozhraní Copilot Studio prostřednictvím rozhraní REST API Power Platform nebo přidáním akcí v nástrojích, tocích nebo Power Automate.

Hodnocení agentů měří správnost a výkon, nikoli problémy s etikou nebo bezpečností AI. Agent může projít všemi hodnotícími testy, ale přesto například odpoví nevhodně na otázku. Zákazníci by stále měli používat zodpovědné revize umělé inteligence a bezpečnostní filtry obsahu; hodnocení nenahrazují tyto revize a filtry.

Omezení vládního komunitního cloudu

Hodnocení agentů v prostředí Government Community Cloud (GCC) má následující omezení:

  • Výrobci nemohou přidat uživatelský profil do svých testovacích sad. Výrobci však mohou stále provádět hodnocení i bez uživatelského profilu.

  • Výrobci nemohou použít metodu testu podobnosti pro hodnocení. Všechny ostatní testovací metody jsou k dispozici.

Jak funguje hodnocení agentů

Copilot Studio používá pro každé vyhodnocení agenta testovací případ. Testovací případ je jedna interakce, která simuluje způsob interakce uživatele s vaším agentem. Interakce může být jedna otázka nebo celá konverzace.

Testovací případ může také obsahovat odpověď, kterou očekáváte , že vám agent odpoví. Příklady:

  • Otázka: Jaké máte pracovní hodiny?

  • Očekávaná odpověď: Jsme otevřeni od 9:00 do 17:00, pondělí až pátek.

Pomocí vyhodnocení agentů můžete generovat, importovat nebo ručně napsat skupinu testovacích případů. Tato skupina testovacích případů se nazývá testovací sada. Testovací sada vám umožňuje:

  • Spusť více testovacích případů, které pokrývají širokou škálu schopností najednou, místo toho, abys se svého agenta ptal na jednu otázku po druhé.

  • Analyzujte výkon svého agenta pomocí snadno stravitelného souhrnného skóre a také se zaměřte na jednotlivé testovací případy.

  • Testujte změny u svých agentů pomocí stejné testovací sady, abyste měli objektivní standard pro měření a porovnání změn ve výkonu.

  • Rychle vytvořte nové testovací sady nebo upravte stávající tak, aby pokrývaly měnící se schopnosti nebo požadavky agentů.

Každá testovací sada může vyhodnotit vašeho agenta pomocí více testovacích metod najednou.

Můžete také zvolit profil uživatele, který bude fungovat jako stimulovaný uživatel. Agent může být nakonfigurován tak, aby reagoval na různé uživatele různými způsoby, nebo umožňoval přístup ke zdrojům různými způsoby.

Když vyberete testovací sadu a spustíte vyhodnocení agenta, Copilot Studio odešle otázky v testovacích případech, zaznamená odpovědi agenta, porovná tyto odpovědi s očekávanými odpověďmi nebo standardní kvalitou a přiřadí skóre každému testovacímu případu. Můžete také vidět detaily, přepis a mapu aktivit pro každý testovací případ a jaké zdroje váš agent použil k vytvoření odpovědi.

Vytvoření komplexní strategie hodnocení

Před spuštěním vyhodnocení definujte, jak vypadá úspěch vašeho agenta, a rozhodněte se, které scénáře jsou pro vaše obchodní výsledky nejdůležitější. Jasná strategie vám pomůže zvolit správné testovací metody, určit prioritu vysoce ovlivněných testovacích případů a interpretovat výsledky se správným kontextem.

Integrace vyhodnocení do automatizovaných toků

Vyhodnocení agenta podporuje automatizaci, aby tvůrci mohli spouštět hodnocení bez ručního zásahu. Pomocí rozhraní REST API nebo konektorů Power Platform můžete programově aktivovat spuštění vyhodnocení a integrovat testování do automatizovaných pracovních postupů, jako jsou kanály kontinuální integrace a průběžného nasazování (CI/CD). Tento přístup umožňuje spouštět testovací sady ve velkém měřítku a ověřovat chování agenta při zavádění změn bez nutnosti ručního spuštění v Copilot Studio.

Testovací chat versus hodnocení agentem

Každá metoda testování vám poskytne odlišný vhled do vlastností a chování vašeho agenta:

Testovací chat:

  • Přijímá a odpovídá na jednu otázku najednou. Je těžké opakovat stejné testy opakovaně.

  • Umožňuje vám otestovat celou relaci obsahující více zpráv.

  • Umožňuje vám komunikovat s vaším agentem jako uživatelem pomocí chatovacího rozhraní.

Hodnocení agenta:

  • Pomocí testovací sady můžete vytvořit a spustit více testovacích případů najednou. Testy můžete opakovat testováním se stejnou testovací sadou.

  • Může testovat jednu otázku a jednu odpověď na testovací případ nebo jednu konverzaci na testovací případ. Nicméně máte menší kontrolu nad konverzacemi než při použití testovacího chatu.

  • Vyberte různé uživatelské profily, abyste simulovali různé uživatele, aniž byste museli sami provádět interakce.

Když testujete agenta, použijte jak testovací chat, tak hodnocení agenta, abyste získali úplný obraz o agentovi.

Jazyková podpora při hodnocení agenta

Agenti v Copilot Studio podporují více jazyků. Pokud nakonfigurujete svého agenta tak, aby podporoval více jazyků, můžete si pro konkrétní hodnocení vybrat jazyk, který chcete.

U vícejazyčného agenta mají následující hodnotící komponenty specifické chování:

Generování dotazů

Výchozí jazyk je jazyk, který nejčastěji používáte při zadávání hodnotících vstupů. Vyberte jazyk, ve kterém chcete hodnocení spustit. Když spustíte více vyhodnocení, výstup je ve stejném jazyce jako vstup.

Spuštění hodnoticího nástroje

Při hodnocení vícejazyčného agenta metoda porovnání významu porovnává očekávanou odpověď s odpovědí agenta. Pokud nastane problém týkající se více jazyků, systém detekuje nesoulad, hodnotitel porovnání významu označí odpověď jako neúspěšnou a odpověď je označena jako neúspěšná kvůli jazykové nekonzistenci.

Vysvětlovací výstup

Ve vícekolových konverzacích s vícejazyčným agentem agent uvádí své odůvodnění ve stejném jazyce, jaký používá ve svých odpovědích.

Limitations

Vyhodnocování agenta v současné době nepodporuje datové agenty Fabric.