管理评估器
评估器定义如何为 Agent 的实际输出或执行轨迹评分。平台提供预置 LLM 评估器,也支持使用提示词创建业务评估器;两者都可以在实验中选择。
前提条件
- 已登录 Agent Insight,并能打开 评测中心 > 评估器。
- 准备运行评测时,已在 配置 > 模型注册配置并测试默认评测模型。
- 创建自定义评估器时,已明确评估对象、评分标准和判定依据。
预置评估器
打开 评测中心 > 评估器,切换 预置评估器,根据看结果、看轨迹及是否依赖参考数据选择模板。
当前可选的六个预置评估器如下:
| 评估器 | 关注内容 | 是否需要所有样本有参考答案 |
|---|---|---|
| Agent 任务完成度 | 是否完成用户目标、答案是否可用 | 是 |
| Agent 轨迹质量 | 规划、工具调用及过程质量 | 否 |
| 结果准确性 | 实际输出中的主张是否与参考答案一致 | 是 |
| 答案质量 | 相关性、完整性、连贯性 | 否 |
| 忠实度 | 答案主张是否得到执行轨迹的证据支持 | 否 |
| 指令遵循 | 是否满足任务及系统指令约束 | 否 |
六个模板的数值评分范围均为 0~100。首次评测可只选择一到两个最相关的评估器,以便逐条检查评分依据。
结果准确性检查实际输出中可由参考答案判断的主张。没有可验证主张,或参考答案未涉及这些主张时,评测可能完成但没有数值分数;这类结果不计入均分。它不用于判断参考答案中的要点是否全部被回答。
创建自定义评估器
- 在评估器页面切换 自建评估器。
- 单击 + 新建自定义评估器。
- 填写名称。名称长度为 2~50 个字符,以英文字母开头,只使用英文字母、数字、下划线或连字符,例如
linux_answer_check。 - 选择 看结果或 看轨迹类目,可填写描述。
- 在 评估提示词中说明检查目标、打分标准和证据要求。
- 根据需要添加评分点及说明。
- 核对输出约定,单击 创建。
提示词只支持以下四个变量:
| 变量 | 内容 |
|---|---|
\{\{input}} | 任务输入 |
\{\{output}} | 实际输出 |
\{\{reference_output}} | 参考答案 |
\{\{trajectory}} | 平台整理的工具调用顺序及失败摘要 |
例如,检查 Linux 命令回答是否简洁且可操作:
text
请检查下面的 Linux 命令回答。
任务输入:{{input}}
实际输出:{{output}}
检查回答是否直接回应用户问题,是否给出可执行的命令,是否解释必要参数。
按 0~100 分评分,给出中文评分依据。
评分依据以“因此,应该给出[分数]是合理的评分”结束,替换其中的分数。如果提示词使用 {{reference_output}},该评估器会被标记为依赖参考数据;创建实验时,所有已选样本必须先补齐参考答案才能选择它。自建评估器可在创建实验的评估器步骤中使用。当前创建入口提供 LLM 评估器。
验证结果
- 创建成功后返回 自建评估器列表,可以搜索并查看新建的评估器。
- 单击评估器卡片,核对类目、提示词和评分点。需要调整时从详情进入编辑。
- 在 评测中心 > 实验 > 新建实验的 评估器步骤中可以找到该评估器。使用了
{{reference_output}}时,先为所有已选样本补齐参考答案。 - 选择一条已完成 Trace 进行试评,检查分数与原因是否遵循提示词,再扩大评测范围。
常见问题
为什么提示名称不合法
使用长度为 2~50 个字符、以英文字母开头的名称,例如 linux_answer_check。名称中不要使用中文、空格或其他特殊字符。
为什么提示不支持某个变量
仅使用本章列出的四个变量。业务要求可以直接写在提示词文本中,不要自行增加未定义的 {{变量}}。
为什么评估器在实验中不可选
需要参考答案的评估器要求所有已选样本均有参考答案。返回 预期答案步骤补齐;监听模式的新 Trace 没有逐条参考答案,因此不允许选择依赖参考数据的评估器。
文档捉虫