評估 Agent (預覽版)

[本文章是發行前版本文件,隨時可能變更。]

新 Agent 體驗中的評估索引標籤為您的 Agent 提供結構化且可重複的測試。 利用評估來衡量各測試案例中的客服品質,追蹤隨時間的改進,並在發布前驗證客服的行為。

Important

  • 此為生產就緒型預覽功能。
  • 生產就緒型預覽版應受補充使用條款所拘束。

什麼是經紀人評估?

Agent 評估讓您能夠系統性地測試 Agent 的回覆是否達到品質標準。 與其在 預覽 標籤中手動測試每個情境,不如建立包含測試對話的評估,定義如何衡量回應,並執行評估以取得量化結果。

評估幫助你回答以下問題:

  • Agent 是否能在各種預期情境中正確回答?
  • 設定變更是提升還是降低回覆品質?
  • 客服人員會在應該叫的時候叫工具嗎?

關鍵概念

以下概念在 Copilot Studio 中執行評估時非常重要:

對話

每個交談都是一個測試案例,用以代表 Agent 需要處理的特定情境。 每個交談都包含使用者訊息,以及選用的預期 Agent 回覆。 將交談歸入評估。 您可以手動建立對話、用 AI 生成對話,或從 CSV 檔案上傳。

評估

評估是一個結合交談與測試方法的具名測試集。 您可以在評估索引標籤中建立評估,將交談新增至評估,然後執行評估以產生評分結果。

測試方法

測試方法定義 Agent 回覆的評分方式。 目前唯一可用的測試方法是通用 品質(General quality),這是一種基於 AI 的評估,用來評估回答是否符合相關性與完整性等品質標準。

Note

一般品質測試方法不會比較回覆與預期答案。

使用者個人檔案

評估會在使用者設定檔底下執行。 管理哪個認證的設定檔執行評估,讓代理的工具和連線能完全測試。

評估工作流程

請依照以下步驟評估代理人:

  1. 建立評估:在評估索引標籤上,開啟新的評估。 在 為代理人建立測試集中了解更多。
  2. 新增交談:可透過手動寫入、AI 生成、或上傳 CSV 檔案來新增測試交談。
  3. 設定:命名評估、選取測試方法、選取 Agent 版本,並設定使用者設定檔。
  4. 執行評估:選擇 評估 以執行測試並等待結果。 在 「為代理人進行評估」中了解更多。
  5. 審查結果:分析分數並找出改進空間。 了解更多請參閱 查看代理人的評估結果
  6. 反覆調整:調整經紀人的指示、知識或工具,然後再次執行評估以衡量影響。