エージェント評価 CLI の概要

Microsoft 365 Copilot エージェント評価 CLI (@microsoft/m365-copilot-eval) は、構造化された評価と AI ベースのスコアリングによるリッチ結果レポートにより、エージェントの品質をテスト、測定、改善するのに役立ちます。

重要

展開済みの宣言型エージェントの場合は、ガイド付きワークフローの Work IQ Dev Tools (プレビュー) から始めてください。 Work IQ Dev Tools は、互換性のあるエージェント評価 CLI バージョンを管理し、 wiqd agent evalを通じて公開します。 低レベルのコマンド制御が必要な場合、または既存の runevals ワークフローを維持する必要がある場合は、このセクションのスタンドアロン CLI ガイダンスを使用します。

可能な操作

評価ツールは、次の機能を提供します。

  • バッチ評価と対話型評価を実行します。
  • Microsoft Foundry クラウドの評価と組み込みのメトリックを使用して、回答を自動的にスコア付けします。
  • JSON データセット、インライン プロンプト、または対話型入力を使用してテストします。
  • HTML、JSON、または CSV 形式でレポートを生成します。

評価メトリック

各応答は、標準的な評価メトリックを使用してスコア付けされます。

Evaluator 型 [倍率] 既定のしきい値 既定値
関連性 LLM ベース 1-5 3 はい
コヒーレンス LLM ベース 1-5 3 はい
グラウンディングネス LLM ベース 1-5 3 不要
類似性 LLM ベース 1-5 3 不要
RetrievalQuery LLM 以外 成功/失敗 該当なし いいえ
RetrievalResult LLM 以外 比例 1.0 不要
引用 カウントベース >= 0 1 不要
ExactMatch 文字列一致 ブール値 該当なし いいえ
PartialMatch 文字列一致 0.0-1.0 0.5 不要

構成オプションやサンプル データセットなど、各エバリュエーターの詳細については、「 エバリュエーター リファレンス」を参照してください。

評価ワークフローのしくみ

評価は、一貫したワークフローに従います。

  1. CLI をインストールして構成します。
  2. 環境構成と資格情報を指定します。
  3. テスト プロンプトのデータセットを作成します。
  4. エージェントに対して評価を実行します。
  5. 結果を確認し、反復処理します。

必須の環境変数

評価ツールでは、環境変数を使用してテナントと Microsoft Foundry プロジェクトを認証して接続します。

変数 説明 既定値
TENANT_ID エージェントが展開されている Microsoft Entra テナント ID。 なし
AZURE_AI_PROJECT_ENDPOINT クラウドの評価に使用される Microsoft Foundry プロジェクト エンドポイント。 なし
AZURE_AI_MODEL_NAME Microsoft Foundry プロジェクト内のモデル デプロイ名。 gpt-5-mini
M365_TITLE_ID (省略可能) 評価用の Microsoft 365 エージェント ID を自動検出するために使用されるタイトル ID。 なし
M365_AGENT_ID (省略可能) 評価用の明示的なエージェント ID。 自動検出元 M365_TITLE_ID

これらの値により認証が有効になり、ツールが Microsoft Foundry を使用して LLM ベースの評価スコアリングを実行できるようになります。 これらの値を取得する方法の詳細については、「 環境変数の値の取得」を参照してください。