Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
[Denne artikkelen er forhåndsutgitt dokumentasjon og kan endres.]
Evaluer-fanen i den nye agentopplevelsen gir strukturert, repeterbar testing for agenten din. Bruk evalueringer til å måle agentkvalitet på tvers av testtilfeller, spore forbedringer over tid, og validere agentens atferd før du publiserer den.
Viktig!
- Dette er en produksjonsklar evalueringsfunksjonalitet.
- Produksjonsklare forhåndsversjoner er underlagt tilleggsvilkår for bruk.
Hva er agentvurdering?
Agentevaluering lar deg systematisk teste agentens svar mot kvalitetsstandarder. I stedet for å teste hvert scenario manuelt i Forhåndsvisning-fanen , lag evalueringer med testsamtaler, definer hvordan svarene skal måles, og kjør evalueringene for å få kvantitative resultater.
Evaluering hjelper deg å svare på spørsmål som disse:
- Svarer agenten korrekt i en rekke forventede scenarioer?
- Forbedret eller forringet en konfigurasjonsendring svarkvaliteten?
- Ringer agenten Tools når den skal?
Nøkkelbegreper
Følgende nøkkelbegreper er viktige når du kjører evalueringer i Copilot Studio:
Samtaler
En samtale er et testtilfelle som representerer et scenario du ønsker at agenten din skal håndtere. Hver samtale inkluderer brukermeldinger og eventuelt forventede svar fra agenten. Organiser samtaler i evalueringer. Lag samtaler manuelt, generer dem med AI, eller last dem opp fra en CSV-fil.
Evalueringer
En evaluering er et navngitt testsett som kombinerer samtaler med en testmetode. Du oppretter evalueringer fra Evaluer-fanen, legger til samtaler i dem og kjører dem for å produsere vurderte resultater.
Testmetoder
Testmetoder angir hvordan agentens svar bedømmes. For øyeblikket er den eneste tilgjengelige testmetoden General quality, en AI-basert vurdering av om svarene oppfyller kvalitetsstandarder, som relevans og fullstendighet.
Bemerkning
Generell kvalitet-testmetoden sammenligner ikke svarene med de forventede svarene.
Brukerprofil
Evalueringer kjøres under en brukerprofil. Administrer hvilken autentisert profil som kjører evalueringen slik at agentens verktøy og tilkoblinger er fullt testbare.
Arbeidsflyt for evaluering
Følg disse trinnene for å vurdere en megler:
- Opprett en evaluering: Fra Evaluer-fanen starter du en ny evaluering. Lær mer i Lag et testsett for en agent.
- Legg til samtaler: Legg til testsamtaler ved å skrive dem manuelt, generere dem med kunstig intelligens, eller laste opp en CSV-fil.
- Konfigurer: Gi evalueringen et navn, velg testmetode og agentversjon, og sett brukerprofilen.
- Kjør evalueringen: Velg Evaluer for å kjøre testen og vent på resultatene. Lær mer i Kjør en vurdering av en agent.
- Gå gjennom resultatene: Analyser resultater og identifiser forbedringsområder. Les mer i Se evalueringsresultater for en agent.
- Iterer: Juster agentens instruksjoner, kunnskap eller verktøy, og kjør evalueringen på nytt for å måle effekten.