语言

ToolCallAccuracyEvaluator 类

定义

它 IEvaluator 评估 AI 系统使用提供给它的工具的有效性。

public ref class ToolCallAccuracyEvaluator sealed : Microsoft::Extensions::AI::Evaluation::IEvaluator
[System.Diagnostics.CodeAnalysis.Experimental("AIEVAL001")]
public sealed class ToolCallAccuracyEvaluator : Microsoft.Extensions.AI.Evaluation.IEvaluator
public sealed class ToolCallAccuracyEvaluator : Microsoft.Extensions.AI.Evaluation.IEvaluator
[<System.Diagnostics.CodeAnalysis.Experimental("AIEVAL001")>]
type ToolCallAccuracyEvaluator = class
    interface IEvaluator
type ToolCallAccuracyEvaluator = class
    interface IEvaluator
Public NotInheritable Class ToolCallAccuracyEvaluator
Implements IEvaluator
继承
ToolCallAccuracyEvaluator
属性
实现

注解

ToolCallAccuracyEvaluator 通过检查提供的响应中存在的工具调用来 FunctionCallContent评估这些工具调用与聊天的相关性、这些工具调用的参数正确性、通过 ToolDefinitions提供的工具定义以及从提供的会话中提取参数值的准确性,来衡量 AI 系统使用工具的准确程度。

请注意,目前, ToolCallAccuracyEvaluator 仅支持评估对定义为 AIFunctionDeclarations 的工具的调用。 将忽略通过ToolDefinitions提供的任何其他AITool定义。

ToolCallAccuracyEvaluator 返回一个包含“工具调用准确性”分数的分数 BooleanMetric 。 分数是 false ,如果工具调用不相关或包含对话中不存在的信息,并且 true 工具调用是否与正确提取的参数相关。

注意:ToolCallAccuracyEvaluator 是一个基于 AI 的计算器,它使用 AI 模型来执行其评估。 虽然此评估程序用于执行其评估的提示设计为与模型无关,但此提示(和生成的评估)的性能可能会因所使用的模型而异,在使用较小的/本地模型时可能会特别差。

已针对以下模型测试了使用(并经过优化以很好地处理)使用的提示 ToolCallAccuracyEvaluator 。 因此,将此计算器与以下列表中的模型结合使用可能会产生最佳结果。 (可通过 .. 配置 ChatClient要使用的模型)

GPT-4o

构造函数

名称 说明
ToolCallAccuracyEvaluator()

它 IEvaluator 评估 AI 系统使用提供给它的工具的有效性。

属性

名称 说明
EvaluationMetricNames

Name获取由此EvaluationMetric生成的 s 。IEvaluator

ToolCallAccuracyMetricName

Name BooleanMetric获取返回者 ToolCallAccuracyEvaluator。

方法

名称 说明
EvaluateAsync(IEnumerable<ChatMessage>, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

扩展方法

名称 说明
EvaluateAsync(IEvaluator, ChatMessage, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

EvaluateAsync(IEvaluator, ChatMessage, ChatMessage, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

EvaluateAsync(IEvaluator, ChatMessage, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

EvaluateAsync(IEvaluator, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

EvaluateAsync(IEvaluator, String, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

EvaluateAsync(IEvaluator, String, String, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

评估提供的 modelResponse 并返回包含一 EvaluationResult 个或多个 EvaluationMetrics 的集合。

适用于