管理评估器 ​

评估器定义如何为 Agent 的实际输出或执行轨迹评分。平台提供预置 LLM 评估器,也支持使用提示词创建业务评估器;两者都可以在实验中选择。

前提条件 ​

  • 已登录 Agent Insight,并能打开 评测中心 > 评估器。
  • 准备运行评测时,已在 配置 > 模型注册配置并测试默认评测模型。
  • 创建自定义评估器时,已明确评估对象、评分标准和判定依据。

预置评估器 ​

打开 评测中心 > 评估器,切换 预置评估器,根据看结果、看轨迹及是否依赖参考数据选择模板。

当前可选的六个预置评估器如下:

评估器关注内容是否需要所有样本有参考答案
Agent 任务完成度是否完成用户目标、答案是否可用是
Agent 轨迹质量规划、工具调用及过程质量否
结果准确性实际输出中的主张是否与参考答案一致是
答案质量相关性、完整性、连贯性否
忠实度答案主张是否得到执行轨迹的证据支持否
指令遵循是否满足任务及系统指令约束否

六个模板的数值评分范围均为 0~100。首次评测可只选择一到两个最相关的评估器,以便逐条检查评分依据。

结果准确性检查实际输出中可由参考答案判断的主张。没有可验证主张,或参考答案未涉及这些主张时,评测可能完成但没有数值分数;这类结果不计入均分。它不用于判断参考答案中的要点是否全部被回答。

创建自定义评估器 ​

  1. 在评估器页面切换 自建评估器。
  2. 单击 + 新建自定义评估器。
  3. 填写名称。名称长度为 2~50 个字符,以英文字母开头,只使用英文字母、数字、下划线或连字符,例如 linux_answer_check。
  4. 选择 看结果或 看轨迹类目,可填写描述。
  5. 在 评估提示词中说明检查目标、打分标准和证据要求。
  6. 根据需要添加评分点及说明。
  7. 核对输出约定,单击 创建。

提示词只支持以下四个变量:

变量内容
\{\{input}}任务输入
\{\{output}}实际输出
\{\{reference_output}}参考答案
\{\{trajectory}}平台整理的工具调用顺序及失败摘要

例如,检查 Linux 命令回答是否简洁且可操作:

text
请检查下面的 Linux 命令回答。
任务输入:{{input}}
实际输出:{{output}}

检查回答是否直接回应用户问题,是否给出可执行的命令,是否解释必要参数。
按 0~100 分评分,给出中文评分依据。
评分依据以“因此,应该给出[分数]是合理的评分”结束,替换其中的分数。

如果提示词使用 {{reference_output}},该评估器会被标记为依赖参考数据;创建实验时,所有已选样本必须先补齐参考答案才能选择它。自建评估器可在创建实验的评估器步骤中使用。当前创建入口提供 LLM 评估器。

验证结果 ​

  • 创建成功后返回 自建评估器列表,可以搜索并查看新建的评估器。
  • 单击评估器卡片,核对类目、提示词和评分点。需要调整时从详情进入编辑。
  • 在 评测中心 > 实验 > 新建实验的 评估器步骤中可以找到该评估器。使用了 {{reference_output}} 时,先为所有已选样本补齐参考答案。
  • 选择一条已完成 Trace 进行试评,检查分数与原因是否遵循提示词,再扩大评测范围。

常见问题 ​

为什么提示名称不合法 ​

使用长度为 2~50 个字符、以英文字母开头的名称,例如 linux_answer_check。名称中不要使用中文、空格或其他特殊字符。

为什么提示不支持某个变量 ​

仅使用本章列出的四个变量。业务要求可以直接写在提示词文本中,不要自行增加未定义的 {{变量}}。

为什么评估器在实验中不可选 ​

需要参考答案的评估器要求所有已选样本均有参考答案。返回 预期答案步骤补齐;监听模式的新 Trace 没有逐条参考答案,因此不允许选择依赖参考数据的评估器。