Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Die Microsoft 365 Copilot Agent-Evaluierungs-CLI enthält eine Reihe von Bewertern, die die Antworten Ihres Agents automatisch bewerten. Jeder Evaluator misst einen anderen Aspekt der Qualität, von der semantischen Relevanz bis zum exakten Zeichenfolgenabgleich. In diesem Artikel werden die einzelnen Evaluatoren, ihr Bewertungsverhalten, ihre Konfigurationsoptionen und ihre Verwendung in Ihren Testdatasets beschrieben.
Informationen zum Konfigurieren von Evaluatoren in Ihren Datasets finden Sie unter Konfigurieren von Evaluatoren.
Sie finden das Evaluierungsdatasetschema im JSON-Schemaformat auf GitHub.
Zusammenfassung des Bewerters
In der folgenden Tabelle sind alle verfügbaren Bewerter zusammengefasst.
| Evaluator | Typ | Skalierung | Standardschwellenwert | Standardmäßig aktiviert | Erforderliche Felder |
|---|---|---|---|---|---|
| Relevanz | LLM-basiert | 1-5 | 3 | Ja | prompt |
| Kohärenz | LLM-basiert | 1-5 | 3 | Ja | prompt |
| Groundedness | LLM-basiert | 1-5 | 3 | Nein | prompt |
| Ähnlichkeit | LLM-basiert | 1-5 | 3 | Nein |
prompt, expected_response |
| RetrievalQuery | Nicht-LLM | Erfolgreich/nicht bestanden | Nicht zutreffend | Nein |
prompt, Evaluator-Konfiguration |
| RetrievalResult | Nicht-LLM | Proportional | 1.0 | Nein |
prompt, Evaluator-Konfiguration |
| Zitate | Anzahlbasiert | >= 0 | 1 | Nein | prompt |
| PartialMatch | Übereinstimmung der Zeichenfolge | 0.0-1.0 | 0.5 | Nein |
prompt, expected_response |
| Exakter Treffer | Übereinstimmung der Zeichenfolge | Boolean | Nicht zutreffend | Nein |
prompt, expected_response |
LLM-basierte Evaluatoren
LLM-basierte Evaluatoren verwenden ein Azure OpenAI-Modell in Ihrem Microsoft Foundry-Projekt (konfiguriert über Ihre Umgebungsvariablen), um die Qualität der Antwort des Agents zu beurteilen. Diese Auswertungen werden vom Azure KI-Auswertungs-SDK unterstützt. Die Punktzahlen reichen von 1 bis 5 auf einer Likert-Skala, wobei höhere Werte eine bessere Qualität anzeigen. Standardmäßig ist eine Punktzahl von 3 oder höher erforderlich, um erfolgreich zu bestehen. Sie können die erforderliche Punktzahl in Ihrer Testkonfiguration ändern.
Relevanz
Die Relevanzbewertung bewertet, wie gut die Antwort des Agenten auf die Anfrage des Benutzers eingeht. Es wird ausgewertet, ob die Antwort die gestellte Frage direkt und vollständig beantwortet.
- Standardmäßig aktiviert: Nein
- Skala: 1-5 (Likert)
- Standardschwellenwert: 3
-
Erforderliche Felder:
prompt - Ground Truth erforderlich: Nein
Die Relevanzauswertung erfordert kein expected_response - sie wertet nur die Beziehung zwischen der Abfrage und der Antwort aus.
Relevance sample dataset
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Relevance": {}
},
"items": [
{
"prompt": "What are the key features of our enterprise plan?",
"expected_response": "The enterprise plan includes advanced security, unlimited storage, 24/7 support, and custom integrations."
}
]
}
Kohärenz
Der Kohärenz-Evaluator misst die logische und geordnete Präsentation von Ideen in der Antwort des Agenten. Es bewertet, ob die Antwort klare Verbindungen zwischen Sätzen, geeignete Übergänge und eine logische Abfolge von Ideen aufweist, die leicht nachvollziehbar ist.
- Standardmäßig aktiviert: Nein
- Skala: 1-5 (Likert)
- Standardschwellenwert: 3
-
Erforderliche Felder:
prompt - Ground Truth erforderlich: Nein
Coherence sample dataset
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Coherence": {}
},
"items": [
{
"prompt": "Explain the process for submitting an expense report.",
"expected_response": "To submit an expense report, first collect your receipts. Then open the expense portal, create a new report, attach your receipts, and submit for manager approval."
}
]
}
Groundedness
Der Groundedness-Evaluator prüft, ob die Antwort des Agenten mit dem bereitgestellten Grounding-Kontext übereinstimmt und durch diesen unterstützt wird. Es konzentriert sich auf Präzision, indem überprüft wird, dass die Antwort keine Behauptungen oder Informationen enthält, die über das hinausgehen, was die abgerufenen Dokumente stützen.
- Standardmäßig aktiviert: Nein
- Skala: 1-5 (Likert)
- Standardschwellenwert: 3
-
Erforderliche Felder:
prompt,expected_response - Ground Truth erforderlich: Nein
Verwenden Sie den Groundedness-Evaluator, um Halluzinationen oder nicht belegte Behauptungen in den Antworten Ihres Agenten zu erkennen.
Groundedness sample dataset
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Relevance": {},
"Groundedness": {}
},
"items": [
{
"prompt": "What is our company's remote work policy?",
"expected_response": "Employees can work remotely up to 3 days per week with manager approval."
}
]
}
Ähnlichkeit
Der Similarity-Evaluator misst den Grad der semantischen Ähnlichkeit zwischen der Antwort des Agenten und einer bereitgestellten expected_response (Ground Truth). Im Gegensatz zu Token-Überlappungsmetriken wie F1 oder Bilingual Evaluation Understudy (BLEU) konzentriert es sich auf die Bedeutung und den breiteren Kontext und nicht auf oberflächliche Wortübereinstimmungen.
- Standardmäßig aktiviert: Nein
- Skala: 1-5 (Likert)
- Standardschwellenwert: 3
-
Erforderliche Felder:
prompt,expected_response - Ground Truth erforderlich: Nein
Sie müssen in Ihrem Dataset Elemente für den Ähnlichkeitsauswertungator konfigurieren expected_response .
Ähnlichkeitsbeispieldataset
{
"schemaVersion": "1.6.0",
"default_evaluators": {
"Similarity": {}
},
"items": [
{
"prompt": "What is Microsoft Graph?",
"expected_response": "Microsoft Graph is a unified API endpoint that provides access to data and intelligence in Microsoft 365 services."
}
]
}
Retrieval evaluators
Abruf-Evaluatoren validieren die End-to-End-Abrufpipeline Ihres Microsoft 365 Copilot-Agents. Sie untersuchen, wie der Agent Benutzerabfragen in Abrufvorgänge übersetzt und ob die erwarteten Ressourcen in den Ergebnissen angezeigt werden. Diese Evaluatoren verwenden keinen LLM-Richter - sie führen deterministische Prüfungen der Abrufausführungsdaten durch.
RetrievalQuery
Die RetrievalQuery-Auswertung überprüft, ob Copilot die Benutzerabsicht korrekt in Abrufabfragen übersetzt hat. Es überprüft die queryString Werte innerhalb des Normalisierten retrieval_executions[] und überprüft, ob sie den erwarteten Mustern entsprechen.
- Standardmäßig aktiviert: Nein
- Maßstab: Erfolgreich/nicht bestanden
- Standardschwellenwert: Nicht zutreffend
-
Erforderliche Felder:
prompt, Evaluator-Konfiguration - Ground Truth erforderlich: Nein
RetrievalQuery-Konfigurationsoptionen
| Option | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
capability |
string | Ja | Die Abruffähigkeit, um festzulegen, welche Ausführungen untersucht werden (z. B. "OneDriveAndSharePoint", "Email", "GraphConnectors"). |
selector |
string | Ja | Eine Teilzeichenfolge ohne Berücksichtigung der Groß-/Kleinschreibung, die zum Identifizieren der Zielabfrage innerhalb der Abrufausführungen verwendet wird. |
includes |
string | Ja | Teilzeichenfolgen, die alle in der übereinstimmenden Abfrage vorkommen MÜSSEN. |
excludes |
string | Ja | Teilzeichenfolgen, die NICHT in der übereinstimmenden Abfrage vorkommen dürfen. |
RetrievalQuery-Beispieldataset
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Find the Q4 sales report in SharePoint",
"expected_response": "Here is the Q4 sales report.",
"evaluators": {
"RetrievalQuery": {
"capability": "OneDriveAndSharePoint",
"selector": "Q4 sales report",
"includes": ["projections", "profit"],
"excludes": ["FileType:OneNote"]
}
}
}
]
}
RetrievalResult
Der RetrievalResult-Auswertungator überprüft, ob die erwarteten Ressourcen tatsächlich in den Dokumenten, Nachrichten und Elementen erscheinen, die von der Abrufausführung zurückgegeben werden. Es überprüft, ob bestimmte Textausschnitte in Abrufen von Trefferextrakten innerhalb eines konfigurierbaren Rangschwellenwerts vorhanden sind.
- Standardmäßig aktiviert: Nein
- Maßstab: Proportional (0,0-1,0)
- Standardschwellenwert: 1,0 (alle Überprüfungen müssen bestanden werden)
-
Erforderliche Felder:
prompt, Evaluator-Konfiguration - Ground Truth erforderlich: Nein
Die Punktzahl ist proportional zur Anzahl der gefundenen erwarteten Elemente. Wenn beispielsweise 2 von 3 erwarteten Elementen gefunden werden, beträgt die Punktzahl 0,67. Ein Durchlaufen erfordert jedoch, dass alle Überprüfungen erfolgreich sind (Schwellenwert ist immer 1,0). Sie müssen mindestens eines der expected_items oder min_expected_count.
RetrievalResult-Konfigurationsoptionen
| Option | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
expected_items |
Array | Bedingter | Array von Objekten, die die erwarteten Ergebnisse angeben. Jedes Objekt kann retrievalExtract_contains enthalten (einen Textausschnitt, der in Abrufen von Trefferextrakten abgeglichen werden soll). Sie müssen mindestens eines der expected_items oder min_expected_count. |
expected_items[].retrievalExtract_contains |
string | Nein | Ein Textausschnitt, der in einem Abruf-Trefferextrakt angezeigt werden muss. |
min_expected_count |
ganze Zahl | Bedingter | Mindestanzahl der Ergebnisse, die abgerufen werden müssen. Sie müssen mindestens eines der expected_items oder min_expected_count. |
max_rank |
ganze Zahl | Nein | Maximale Rangposition, die beim Abgleichen erwarteter Elemente zu berücksichtigen ist. Standardwert ist 10. |
RetrievalResult-Beispieldataset
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Find recent emails about the Contoso project",
"expected_response": "Here are the recent emails about the Contoso project.",
"evaluators": {
"RetrievalResult": {
"expected_items": [
{ "retrievalExtract_contains": "update" },
{ "retrievalExtract_contains": "budget" }
],
"max_rank": 5,
"min_expected_count": 2
}
}
}
]
}
Zeichenfolgen- und anzahlbasierte Auswertungen
Diese Auswertungen verwenden deterministische Zeichenfolgenabgleichs- oder Zähllogik. Sie benötigen keinen LLM und werden lokal ausgeführt.
Zitate
Die Zitate-Auswertung zählt die Anzahl der Zitatverweise in der Antwort des Agenten, z[1][2]. B. Zitate im Link-Stil. Es überprüft, ob der Agent seine Behauptungen ordnungsgemäß Quellen zuschreibt. Legen Sie den Schwellenwert auf die erwartete Anzahl von Zitaten fest.
- Standardmäßig aktiviert: Nein
- Maßstab:>= 0 (Anzahl)
- Standardschwellenwert: 1
-
Erforderliche Felder:
prompt - Ground Truth erforderlich: Nein
Die Punktzahl entspricht der Anzahl der Zitate, und standardmäßig ist mindestens 1 Zitat erforderlich, um bestanden zu werden.
Konfigurationsoptionen für Zitate
| Option | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
citation_format |
string | Nein | Gibt das erwartete Zitierformat an, z. B "mixed". |
Zitate Beispieldataset
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "What is our return policy?",
"expected_response": "Our return policy allows returns within 30 days [1].",
"evaluators": {
"Citations": {
"threshold": 2,
"citation_format": "mixed"
}
}
}
]
}
PartialMatch
Der PartialMatch-Evaluator misst den Grad der textuellen Überlappung zwischen der Antwort des Agenten und der expected_response Ähnlichkeit auf Tokenebene (analog zu einem F1-Score-Ansatz). Diese Auswertung ist nützlich, wenn Sie erwarten, dass die Antwort Schlüsselphrasen oder Informationen aus der erwarteten Antwort enthält, aber keine wörtliche Übereinstimmung benötigt wird.
- Standardmäßig aktiviert: Nein
- Maßstab: 0.0-1.0
- Standardschwellenwert: 0,5
-
Erforderliche Felder:
prompt,expected_response - Ground Truth erforderlich: Nein
Die Punktzahl reicht von 0,0 (keine Überlappung) bis 1,0 (vollständige Übereinstimmung).
PartialMatch-Beispieldataset
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "Who is the CEO of Contoso?",
"expected_response": "The CEO of Contoso is Jane Smith.",
"evaluators": {
"PartialMatch": {}
}
}
]
}
Exakter Treffer
Der ExactMatch-Evaluator führt einen direkten Zeichenfolgenvergleich zwischen der Antwort des Agents und der konfigurierten expected_response. Sie gibt einen booleschen Durchlauf oder Fehler zurück – entweder stimmt die Antwort genau überein oder nicht. Dieser Auswertungator ist nützlich für Eingabeaufforderungen mit deterministischen oder formelhaften erwarteten Antworten.
- Standardmäßig aktiviert: Nein
- Maßstab: Boolesch (erfolgreich oder nicht bestanden)
- Standardschwellenwert: Nicht zutreffend
-
Erforderliche Felder:
prompt,expected_response - Ground Truth erforderlich: Nein
ExactMatch-Konfigurationsoptionen
| Option | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
case_sensitive |
Boolescher Wert | Nein | Steuert, ob beim Vergleich zwischen Groß- und Kleinschreibung unterschieden wird. Standardwert ist true. |
ExactMatch-Beispieldataset
{
"schemaVersion": "1.6.0",
"items": [
{
"prompt": "What is 2 + 2?",
"expected_response": "4",
"evaluators": {
"ExactMatch": { "case_sensitive": false }
}
}
]
}