Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Die Microsoft 365 Copilot Agent Evaluations CLI (@microsoft/m365-copilot-eval) hilft Ihnen, die Qualität Ihrer Agenten durch automatisierte Prompt-Bewertung und KI-basiertes Scoring zu testen, zu messen und zu verbessern. In dieser Schnellstartanleitung werden Sie durch die Installation des Agent-Evaluierungstools, die Konfiguration Ihrer Umgebung, das Erstellen Ihres ersten Datasets und das Ausführen einer Auswertung geführt.
Voraussetzungen
Stellen Sie zunächst sicher, dass Sie über Folgendes verfügen:
- Ein auf Ihrem Mandanten bereitgestellter Microsoft 365 Copilot-Agent.
-
Node.js 24.12.0 oder höher (zur Überprüfung verwenden
node --version). - Copilot-Guthaben in Ihrem Mandanten verfügbar. Die Agent-Evaluierungs-CLI verbraucht Copilot-Guthaben, wenn sie Test-Prompts an Ihren Agent sendet. Ihr Mandantenadministrator aktiviert die verbrauchsbasierte (getaktete) Abrechnung im Microsoft 365 Admin Center, indem er zum Copilot>Cost Management-Knoten wechselt. Weitere Informationen finden Sie unter Verwalten von Copilot-Guthaben.
- Ein Microsoft Foundry-Projekt mit einem GPT-5-Modell, das zur Bewertung von Antworten bereitgestellt wird. Weitere Informationen finden Sie unter Abrufen von Werten für Umgebungsvariablen.
- Microsoft Entra-Administratoreinwilligung für Work IQ in Ihrem Mandanten erteilt. Wenn Sie kein Mandantenadministrator sind, bitten Sie Ihren Administrator, vor der ersten Ausführung
runevalsIhre Zustimmung zu erteilen. Weitere Informationen finden Sie unter Erteilen der Administratoreinwilligung. - Ihre Mandanten-ID und der Microsoft Foundry-Projektendpunkt. Wenn Sie diese Werte nicht haben, lesen Sie Abrufen von Werten für Umgebungsvariablen.
Hinweis
In dieser Schnellstartanleitung wird davon ausgegangen, dass Sie eine Windows-Entwicklungsumgebung verwenden. Die Authentifizierungsunterstützung für andere Betriebssysteme ist in Kürze verfügbar.
Schritt 1: Installieren der CLI
Installieren Sie die Agent-Evaluierungs-CLI global mithilfe von npm:
npm install -g @microsoft/m365-copilot-eval
Überprüfen Sie die Installation:
runevals --version
Nach der Installation ist der runevals Befehl global auf Ihrem System verfügbar.
Schritt 2: Einrichten der Projektstruktur
Führen Sie das Evaluierungstool aus dem Projektverzeichnis Ihres Microsoft 365-Agents (in dem sich der Agentcode befindet) und nicht aus dem Repository des Evaluierungstools aus.
cd /path/to/your-agent-project
Ihr Agentprojekt sollte die folgenden Dateien und Ordner enthalten:
my-agent/
├── .env.local # Agent configuration (Agents Toolkit projects)
├── .env.local.user # Secrets — never committed
├── evals/
│ └── evals.json # Your test dataset (auto-discovered)
└── .evals/
└── <generated reports> # Results written here (YYYY-MM-DD_HH-MM-SS.html)
Sie erstellen das evals/evals.json Dataset in Schritt 4. Der .evals/ Berichtsordner wird bei der ersten Ausführung automatisch erstellt.
Schritt 3: Konfigurieren von Umgebungsvariablen
Wählen Sie die Option aus, die Ihrem Projekttyp entspricht.
Tipp
Wenn Sie Ihren Agent mit dem Microsoft 365 Agents Toolkit erstellt haben, verfügen Sie bereits über .env.local Ihre Agent-Konfiguration. Erstellen Sie .env.local.user in Ihrem Projekt den Stamm für Geheimnisse.
Microsoft 365 Agents Toolkit-Projekte
Sie legen nicht direkt fest M365_AGENT_ID – die CLI erkennt es automatisch aus M365_TITLE_ID ..env.local Weitere Informationen finden Sie unter Abrufen Ihrer Agent-ID.
Geheimnisse hinzufügen zu .env.local.user:
# .env.local.user (NOT checked in — secrets go here)
TENANT_ID="your-tenant-id-here"
AZURE_AI_PROJECT_ENDPOINT="https://<account>.services.ai.azure.com/api/projects/<project>"
AZURE_AI_MODEL_NAME="gpt-5-mini" # default
Die CLI für Agent-Auswertungen bewertet Antworten mithilfe der Microsoft Foundry-Cloudauswertung, die sich bei Microsoft Entra authentifiziert. Melden Sie sich mit der Azure CLI (az login) an, bevor Sie die runevals Weitere Informationen zu diesen Werten finden Sie unter Abrufen von Werten für Umgebungsvariablen.
Zu Ihrem .gitignorehinzufügen .env.local.user :
# User-specific secrets — never commit
.env.local.user
env/.env.local.user
Schritt 4: Erstellen Ihres ersten Datasets
Erstellen Sie evals/evals.json mit einer kleinen Anzahl von Eingabeaufforderungen und erwarteten Antworten. In diesem Beispiel wird das einfachste gültige Schema für Singleturn-Auswertungen verwendet.
{
"schemaVersion": "1.0.0",
"items": [
{
"prompt": "What is Microsoft 365?",
"expected_response": "Microsoft 365 is a cloud-based productivity suite that includes Office apps, cloud services, and device management."
},
{
"prompt": "How do I share a file in Microsoft Teams?",
"expected_response": "To share a file in Teams, you can upload it to a channel or chat, or share it from OneDrive with specific permissions."
}
]
}
Tipp
Wenn Sie diesen Schritt überspringen, bietet das Tool an, bei der ersten Ausführung runevalseine Startdatei mit Beispielprompts zu generieren.
Vollständiges Datasetschema, Kategorien und erweiterte Muster finden Sie unter Erstellen von Evaluierungstestsammlungen.
Schritt 5: Ausführen der ersten Auswertung
Für Agents Toolkit-Projekte (verwendet .env.local automatisch und .env.local.user):
runevals
Für Nicht-Agents-Toolkit-Projekte:
runevals --env dev
Schritt 6: Bestätigen der erfolgreichen Einrichtung
Ein erfolgreicher Lauf produziert:
Eine Abschlussmeldung im Terminal ähnlich der folgenden Nachricht.
M365 Copilot Agent Evaluations CLI Loading environment: dev Agent ID: T_my-agent.declarativeAgent Using prompts file: ./evals/evals.json Running evaluations... Evals completed successfully! Results saved to: ./.evals/2026-04-22_14-30-45.htmlEin darin gespeicherter
./.evals/YYYY-MM-DD_HH-MM-SS.htmlHTML-Bericht, der automatisch in Ihrem Browser geöffnet wird.
Der Bericht enthält Bewertungen für jede Eingabeaufforderung.
| Evaluator | Typ | Skalierung | Standardschwellenwert | Default |
|---|---|---|---|---|
| Relevanz | LLM-basiert | 1-5 | 3 | Ja |
| Kohärenz | LLM-basiert | 1-5 | 3 | Ja |
| Groundedness | LLM-basiert | 1-5 | 3 | Nein |
| Ähnlichkeit | LLM-basiert | 1-5 | 3 | Nein |
| Zitate | Anzahlbasiert | >= 0 | 1 | Nein |
| Exakter Treffer | Übereinstimmung der Zeichenfolge | Boolescher Wert | Nicht zutreffend | Nein |
| PartialMatch | Übereinstimmung der Zeichenfolge | 0.0-1.0 | 0.5 | Nein |
Wenn diese Ergebnisse nicht angezeigt werden, lesen Sie "Problembehandlung".