单次响应评估仅针对一个独立问题测试您的智能体,而非整个对话。 例如,针对客服智能体的单次回复评估会提问你们的营业时间是什么?,记录智能体对该问题的回复,然后再提出一个新问题,如何查看我的订单历史?
单一回复评估对于测试你的智能体如何回答具体问题、调用哪些能力,以及在回复中使用的具体措辞很有帮助。 你还可以运行对话评估,这可以让你在更长时间的互动中评估你的智能体表现。
评估使用测试集。 单次回复评估的测试集最多可包含 100 个测试用例。 在运行智能体评估时,你需要选择一个测试集,Copilot Studio 会依次执行该测试集中的每个测试用例,并在你的智能体上运行。
您可以在测试集中手动创建测试用例,通过电子表格导入测试用例,或利用 AI 根据您的智能体的设计和资源生成消息。 接下来,您可以选择如何衡量智能体对测试集中的每个测试用例的回复质量。
如需了解智能体评估的工作方式,请参阅关于智能体评估。
如需编辑现有测试集,请参阅更改测试集细节。
重要提示
测试结果在 Copilot Studio 中保留 89 天。 要延长测试结果的保存时间,请将结果导出为 CSV 文件。
创建新测试集
转到您的智能体的评估页面。
选择新评估,然后选择单一回复。
选择要用于创建测试集的方法 一个测试集最多可包含 100 个测试用例。
- 快速问题集可让 Copilot Studio 根据智能体描述、操作指南和功能自动创建测试用例。 该选项会生成 10 个测试问题,用于进行小型快速评估,或作为建立更大测试集的起点。
- 完整问题集,让 Copilot Studio 使用知识来源或主题生成测试用例,并选择要生成的题目数量。
-
使用测试聊天对话,以使用测试聊天中提供的问题自动填充测试集。 这种方法使用最近的测试聊天中的问题。 您也可通过测试聊天界面中的评估
图标启动评估。
- 通过将文件拖入指定区域、选择浏览以上传文件,或选择其他上传选项之一,从文件导入测试用例。
- 或者,您可以自己编写一些问题,以手动创建一个测试集。 根据步骤编辑测试集,以添加和编辑测试用例。
- 使用智能体分析中的基于主题的生产数据。
在名称下,为测试集输入名称。
更改或添加你想使用的测试方法:
- 添加新方法:
- 选择添加测试方法。
- 选择所有你想测试的方法,然后选择确定。
- 有些方法要求及格分数。 及格分数决定了何种得分结果视为通过或失败。 设置好分数,然后选择确定。
- 有些方法需要为每个测试用例添加预期回复或关键词。 有关详细信息,请参阅选择评估方法
- 选择现有测试方法以进行编辑或删除。
测试方法 度量 测试集类型 计分 配置 一般质量 根据特定属性评估测试用例响应的质量 单一回复或对话 计分(满分 100%) 无 比较含义 测试用例答案的语义与预期答案的匹配程度 单个响应 计分(满分 100%) 及格分数和预期答案 工具使用 测试用例是否使用了全部或任何预期的资源 单个响应 通过/未通过 预期能力 关键字匹配 测试用例是否使用了所有或部分预期的关键词或短语 单一回复或对话 通过/未通过 预期关键词或短语 文本相似度 测试用例答案文本与预期答案的匹配程度 单个响应 计分(满分 100%) 及格分数和预期答案 完全匹配 测试用例的答案是否与预期答案完全匹配 单个响应 通过/未通过 预期的答案 自定义 测试用例的回复是否满足所定义的标准或期望。 单一回复或对话 通过/不通过(符合已定义的标签标准) 名称、评估说明、标签 - 添加新方法:
编辑测试用例的具体内容。 除一般质量外,所有测试方法都要求预期回复或关键词。 如需了解有关编辑测试用例的详细信息,请参阅修改测试集。
选择用户配置文件,然后选择或添加你想用于此测试集的帐户,或无需身份验证继续。 评估功能在测试期间使用此帐户连接到知识来源和工具。 如果用于评估的帐户与连接器身份验证的帐户不同,使用连接器或工具的智能体会失败。 有关添加和管理用户配置文件的信息,请参阅管理用户配置文件和连接。
备注
自动化测试使用所选测试帐户的身份验证信息。 如果您的智能体具有需要特定身份验证的知识来源或连接,请为测试选择合适的帐户。 当 Copilot Studio 生成测试用例时,会使用已连接帐户的身份验证凭据来访问您的智能体的知识来源和工具。 生成的测试用例中可能包含连接帐户能够访问的敏感数据。 任何有权访问该智能体的创建者均可查看与该智能体关联的测试集。
选择保存在不运行测试用例的情况下更新测试集,或选择评估以立即运行测试集。
测试用例生成限制
如果有一个或多个问题违反了你的智能体的内容审核设置,则测试用例生成将失败。 原因可能为:
- 智能体的指令或主题导致模型生成被系统判定为违规的内容。
- 连接的知识来源包含敏感或受限内容。
- 智能体的内容审核设置过于严格。
为解决该问题,请尝试采取不同的操作,例如调整知识来源、更新指令或修改内容审核设置。
一个测试集最多可以包含 100 个测试用例。
从知识或主题生成测试集
您可以通过使用智能体已有的信息和对话来源生成问题来测试您的智能体。 这种测试方法适合测试智能体如何利用其已有的知识来源或主题,但不适合用于测试知识缺口。
您可以使用以下知识来源生成测试用例:
文本
Microsoft Word
Microsoft Excel
PDF 文件
SharePoint 内容
您可以使用不超过 5 MB 的文件来生成测试题目。
生成测试集:
在新评估中,选择完整题集。
选择知识或主题。
对于知识,请选择您要用于生成问题的知识来源。
对于知识和主题,请选择并拖动滑块以选择要生成的问题数量。
选择生成。
在名称下,为测试集输入名称。
更改或添加你想使用的测试方法:
编辑测试用例的具体内容。 除了一般质量之外,所有使用方法的测试用例都需要预期回复。 有关编辑的详细信息,请参阅修改测试集。
选择保存在不运行测试用例的情况下更新测试集,或选择评估以立即运行测试集。
创建要导入的测试集文件
无需直接在 Copilot Studio 中生成测试案例,可以创建包含所有测试案例的电子表格文件,并导入它们来创建测试集。 可以撰写每个测试问题,确定要使用的测试方法,然后为每个问题陈述预期响应。 创建完文件后,保存为 .csv 或 .txt 文件,然后导入到 Copilot Studio。
重要提示
- 该文件最多可包含 100 个问题。
- 每个问题最多 1,000 个字符(包括空格)。
- 文件必须使用逗号分隔值 (CSV) 或文本格式。
要创建导入文件,请执行以下操作:
打开电子表格应用程序(例如,Microsoft Excel)。 在选择新评估后,您可以在数据源下面下载 CSV 模板。
按以下顺序在第一行中添加以下标题:
- 问题
- 预期回复
- 测试方法
在问题列中输入测试问题。 每个问题可以不超过 1,000 个字符,包括空格。
在测试方法列中为每个问题输入以下测试方法之一:
- 一般质量
- 比较含义
- 相似度
- 完全匹配
- 关键字匹配
在预期响应列中输入每个问题的预期响应。 导入测试集时,预期响应是可选的。 但是,需要有预期响应才能运行匹配、相似性和比较含义测试案例。
将文件另存为 .csv 或 .txt 文件。
请按照创建新测试集部分中的步骤导入文件。
创建一个基于主题的测试集
创建一个测试集,包含来自真实用户对话的问题。 此方法采用智能体分析中的主题(预览版)。
主题是用户问题库中触发生成式答案的问答组合。 在以主题创建测试集时,你会从用户提出的与该主题相关的问题中生成测试用例。
使用这些测试集对智能体职责范围内的某个领域或主题进行专项评估。 例如,如果你有智能体,你可以将账单和付款问题的回答质量与排查等其他用例分开追踪。
备注
在创建基于主题的测试集之前,您必须拥有分析中主题的访问权限。 查看主题的先决条件(预览版)。
在智能体的分析页上,转到主题列表。
将鼠标悬停在主题上,然后选择评估。
你也可以选择查看全部以查看更多主题,然后选择评估。
选择创建并打开。
编辑测试集和测试用例的详细信息。 除了一般质量之外,所有使用方法的测试用例都需要预期回复。 有关编辑的详细信息,请参阅修改测试集。
选择保存在不运行测试用例的情况下更新测试集,或选择评估以立即运行测试集。