Microsoft 365 Copilot エージェント評価 CLI (@microsoft/m365-copilot-eval) は、構造化された評価と AI ベースのスコアリングによるリッチ結果レポートにより、エージェントの品質をテスト、測定、改善するのに役立ちます。
重要
展開済みの宣言型エージェントの場合は、ガイド付きワークフローの Work IQ Dev Tools (プレビュー) から始めてください。 Work IQ Dev Tools は、互換性のあるエージェント評価 CLI バージョンを管理し、 wiqd agent evalを通じて公開します。 低レベルのコマンド制御が必要な場合、または既存の runevals ワークフローを維持する必要がある場合は、このセクションのスタンドアロン CLI ガイダンスを使用します。
可能な操作
評価ツールは、次の機能を提供します。
- バッチ評価と対話型評価を実行します。
- Microsoft Foundry クラウドの評価と組み込みのメトリックを使用して、回答を自動的にスコア付けします。
- JSON データセット、インライン プロンプト、または対話型入力を使用してテストします。
- HTML、JSON、または CSV 形式でレポートを生成します。
評価メトリック
各応答は、標準的な評価メトリックを使用してスコア付けされます。
| Evaluator | 型 | [倍率] | 既定のしきい値 | 既定値 |
|---|---|---|---|---|
| 関連性 | LLM ベース | 1-5 | 3 | はい |
| コヒーレンス | LLM ベース | 1-5 | 3 | はい |
| グラウンディングネス | LLM ベース | 1-5 | 3 | 不要 |
| 類似性 | LLM ベース | 1-5 | 3 | 不要 |
| RetrievalQuery | LLM 以外 | 成功/失敗 | 該当なし | いいえ |
| RetrievalResult | LLM 以外 | 比例 | 1.0 | 不要 |
| 引用 | カウントベース | >= 0 | 1 | 不要 |
| ExactMatch | 文字列一致 | ブール値 | 該当なし | いいえ |
| PartialMatch | 文字列一致 | 0.0-1.0 | 0.5 | 不要 |
構成オプションやサンプル データセットなど、各エバリュエーターの詳細については、「 エバリュエーター リファレンス」を参照してください。
評価ワークフローのしくみ
評価は、一貫したワークフローに従います。
- CLI をインストールして構成します。
- 環境構成と資格情報を指定します。
- テスト プロンプトのデータセットを作成します。
- エージェントに対して評価を実行します。
- 結果を確認し、反復処理します。
必須の環境変数
評価ツールでは、環境変数を使用してテナントと Microsoft Foundry プロジェクトを認証して接続します。
| 変数 | 説明 | 既定値 |
|---|---|---|
TENANT_ID |
エージェントが展開されている Microsoft Entra テナント ID。 | なし |
AZURE_AI_PROJECT_ENDPOINT |
クラウドの評価に使用される Microsoft Foundry プロジェクト エンドポイント。 | なし |
AZURE_AI_MODEL_NAME |
Microsoft Foundry プロジェクト内のモデル デプロイ名。 | gpt-5-mini |
M365_TITLE_ID (省略可能) |
評価用の Microsoft 365 エージェント ID を自動検出するために使用されるタイトル ID。 | なし |
M365_AGENT_ID (省略可能) |
評価用の明示的なエージェント ID。 | 自動検出元 M365_TITLE_ID |
これらの値により認証が有効になり、ツールが Microsoft Foundry を使用して LLM ベースの評価スコアリングを実行できるようになります。 これらの値を取得する方法の詳細については、「 環境変数の値の取得」を参照してください。