Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
[Denne artikel er foreløbig dokumentation og kan ændres.]
Fanen Evaluer i den nye agentoplevelse giver struktureret testning, der kan gentages, for din agent. Brug evalueringer til at måle agentens kvalitet på tværs af testcases, spor forbedringer over tid og valider din agents adfærd, før du publicerer den.
Vigtig
- Dette er en produktionsklar prøveversionsfunktion.
- Produktionsklare forhåndsversioner er underlagt supplerende vilkår for anvendelse.
Hvad er agentvurdering?
Agentevaluering gør det muligt systematisk at teste din agents svar mod kvalitetsstandarder. I stedet for at teste hvert scenarie manuelt i fanen Preview , kan du oprette evalueringer med testsamtaler, definere hvordan svarene skal måles, og gennemføre evalueringerne for at få kvantitative resultater.
Evaluering hjælper dig med at besvare spørgsmål som disse:
- Svarer agenten korrekt på tværs af en række forventede scenarier?
- Har en konfigurationsændring forbedret eller forringet svarkvaliteten?
- Kalder agenten værktøjer, når den skal?
Nøglebegreber
Følgende begreber er centrale, når du kører evalueringer i Copilot Studio:
Samtaler
En samtale er en testsag, der repræsenterer et scenarie, du ønsker, at din agent skal håndtere. Hver samtale inkluderer brugerbeskeder og eventuelt forventede agentsvar. Organiser samtaler i evalueringer. Opret samtaler manuelt, generer dem med AI, eller upload dem fra en CSV-fil.
Evalueringer
En evaluering er et navngivet testsæt, der kombinerer samtaler med en testmetode. Du opretter evalueringer fra Evaluer-fanen, føjer samtaler til dem og kører dem derefter for at generere scorede resultater.
Testmetoder
Testmetoder fastlægger, hvordan agentens svar bedømmes. I øjeblikket er den eneste tilgængelige testmetode General quality, en AI-baseret vurdering af, om svarene opfylder kvalitetsstandarder såsom relevans og fuldstændighed.
Note
Testmetoden Generel kvalitet sammenligner ikke svar med forventede svar.
Brugerprofil
Evalueringer kører under en brugerprofil. Styr hvilken autentificeret profil der kører evalueringen, så agentens værktøjer og forbindelser er fuldt testbare.
Evalueringsarbejdsgang
Følg disse trin for at vurdere en mægler:
- Opret en evaluering: På fanen Evaluer start en ny evaluering. Lær mere i Opret et testsæt til en agent.
- Tilføj samtaler: Tilføj testsamtaler ved at skrive dem manuelt, generere dem med AI eller uploade en CSV-fil.
- Konfigurer: Navngiv evalueringen, vælg en testmetode, vælg agentversionen, og indstil brugerprofilen.
- Kør evalueringen: Vælg Evaluer for at køre testen og vent på resultaterne. Læs mere i Lav en evaluering af en mægler.
- Gennemgå resultater: Analysér scorer og identificer mulige forbedringsområder. Læs mere i Se evalueringsresultater for en agent.
- Iterer: Juster din mæglers instruktioner, viden eller værktøjer, og kør derefter evalueringen igen for at måle effekten.