RubricBasedEvaluatorDefinition interface
基于评分标准的评估器定义——存储由生成API产生的维度。 用于质量和安全评估。
属性
| dimensions | 尺寸集合——LLM评委使用的评分蓝图。 质量评估器包括一个不可编辑的残余维度,id为“general_quality”(always_applicable:真);安全评估员中包括“general_policy_compliance”。 两者都使用相同的维度结构。 |
| pass_threshold | 总评分标准的通过/不通过阈值,与发出 |
| type | 判别器可能的值:代码、提示、评分标准、终点 |
继承属性
| data_schema | 评估程序的输入数据的 JSON 架构(Draft 2020-12)。 这包括类型、属性等参数,必需。 |
| init_parameters | 计算器输入参数的 JSON 架构(Draft 2020-12)。 这包括类型、属性等参数,必需。 |
| metrics | 此计算器生成的输出指标列表 |
属性详细信息
dimensions
尺寸集合——LLM评委使用的评分蓝图。 质量评估器包括一个不可编辑的残余维度,id为“general_quality”(always_applicable:真);安全评估员中包括“general_policy_compliance”。 两者都使用相同的维度结构。
dimensions: Dimension[]
属性值
pass_threshold
总评分标准的通过/不通过阈值,与发出 score的标准值相同的归一化0.0-1.0量表。 当运行加权平均值达到或超过该值时,结果为 pass。 默认是0.5(相当于1-5加权的原始平均值3.0)。 “任何维度得分1→不合格”的规则依然适用,无论这个门槛如何。
pass_threshold?: number
属性值
number
type
判别器可能的值:代码、提示、评分标准、终点
type: "rubric"
属性值
"rubric"