エージェントを評価する (プレビュー)

[この記事はプレリリース ドキュメントであり、変更されることがあります。]

新しいエージェント体験の [評価] タブでは、エージェントを体系的かつ反復的にテストできます。 評価を使ってテストケース全体のエージェントの質を測定し、時間経過による改善を追跡し、公開前にエージェントの挙動を検証しましょう。

Important

  • これは運用に対応したプレビュー機能です。
  • 運用に対応したプレビューには 追加使用条件 が適用されます。

エージェント評価とは何ですか?

エージェント評価では、品質基準に基づいてエージェントの応答を体系的にテストできます。 プレビュータブで各シナリオを手動でテストするのではなく、テスト会話で評価を作成し、回答の測定方法を定義し、定量的な結果を得るために評価を実行しましょう。

評価は次のような質問に答えるのに役立ちます:

  • エージェントは予想されるさまざまなシナリオで正しく答えていますか?
  • 構成の変更によって応答の品質が向上または劣化することはありますか?
  • エージェントは必要な時にツールを呼びますか?

主な概念

Copilot Studioで評価を行う際に重要な概念は以下のとおりです。

会話

会話とは、エージェントが対応すべきシナリオを表すテストケースです。 各会話にはユーザーメッセージと、必要に応じて期待されるエージェントの応答が含まれています。 会話を評価に整理します。 会話は手動で作成したり、AIで生成したり、CSVファイルからアップロードしたりできます。

評価

評価とは、会話とテスト手法を組み合わせた名前付きのテストセットです。 評価タブから評価を作成してそれに会話を追加し、実行してスコア付きの結果を生成します。

テスト メソッド

テスト方法は、エージェントの応答のスコアリング方法を定義します。 現在利用可能なテスト方法はGeneral qualityで、これは回答が関連性や完全性などの品質基準を満たしているかどうかをAIを活用した評価です。

注:

一般品質テスト方法では、応答と期待される答えを比較しません。

ユーザープロファイル

評価はユーザープロファイルで実行されます。 どの認証済みプロファイルが評価を実行するか管理し、エージェントのツールや接続が完全にテスト可能になるようにしましょう。

評価ワークフロー

エージェントを評価するには以下の手順に従ってください:

  1. 評価を作成する: 評価 タブで新しい評価を開始します。 詳細は「 エージェントのためのテストセットを作成」をご覧ください。
  2. 会話を追加: テスト用の会話を手動で作成・AIで生成・CSVファイルをアップロードして追加します。
  3. 設定: 評価に名前を付け・テスト方法を選択し・エージェントのバージョンを選択し・ユーザープロファイルを設定します。
  4. 評価を実行する: 評価を選択してテスト を実行し、結果を待ちます。 詳しくは 「エージェントの評価を実施」をご覧ください。
  5. 結果を確認: スコアを分析し、改善点を特定します。 詳細は「 エージェントの評価結果を見る」をご覧ください。
  6. 反復:エージェントの指示や知識、ツールを調整し、その後再度評価を行い、影響を測定します。