运行评测实验
实验将一批已经采集的 Trace 与一组评估器组合,为每条样本产生评分。它对实际执行记录进行离线评估,不驱动业务 Agent 重新执行任务。准备样本时,需要先在 Agent 中完成任务并确认 Trace 已上报。
前提条件
- 已完成评测模型配置,且平台能访问该模型服务。
- 目标 Agent 已接入,链路追踪中有相应记录。
- 使用依赖参考数据的评估器时,已准备相应样本的参考答案。
操作步骤
- 打开 评测中心 > 实验,单击 新建实验。
- 在 实验设计中填写实验名称、选择待评测 Agent。当前实验类型为 无变量 · 单组。
- 在 关联 Trace中选择本次评测的记录。候选记录来自当前账号下所选 Agent 的主 Trace,不包含单独的子 Agent Trace:
- 可按 Trace ID 或任务输入搜索,并按时间范围、标签缩小范围。
- 勾选目标记录;跨页全选按钮最多一次选择 500 条。
- 首次建议先选少量已完成且内容完整的记录,便于核对结果。
- 在 预期答案中核对输入和实际输出:
- 单击每条记录的 标注,填写参考输出后单击 保存,确认变为 已标注;也可单击 从数据集导入匹配。
- 数据集按照输入文本去除首尾空白后完全相等来匹配,不做相似度匹配。
- 已填写的参考答案默认保留;数据集中有重复输入时,以首条有效参考答案为准。
- 不使用依赖参考数据的评估器时,可不填写参考答案。
- 根据需要使用 存为数据集,把本次已标注且有输入的参考答案保存供以后复用。
- 在 评估器中选择一项或多项预置或自建评估器。依赖参考数据的评估器在任一样本缺少参考答案时不可选择,可悬停查看原因并返回补充。
- 单击 开始实验。页面进入实验详情并显示评测进度。如果详情停留在草稿状态,使用 开始执行。
预期结果:实验中出现对应样本与评估器的结果,进度显示完成、失败和待执行数量。该进度计算的是“样本 × 评估器”的评测结果行;一条 Trace 使用两个评估器会产生两项结果。
监听模式
如果需要持续评估同一 Agent 后续任务,在创建实验的 关联 Trace步骤启用 监听模式。
- 可以不选择已有 Trace,以零条样本开始监听。
- 自动加入当前账号下所选 Agent 在监听开启后开始、且执行状态为成功的主 Trace;没有上报开始时间时,使用首次入库时间判断。子 Agent Trace 不会单独加入。
- 新 Trace 没有逐条参考答案,因此监听模式不能选择依赖参考数据的评估器。
- 在实验详情单击 停止监听,确认后不再自动加入新 Trace;已开始的评测继续完成,已有结果保留。
查看和处理评测结果
查看整体结果
实验详情提供综合均分、评估器分解和 Case 明细。
- 先检查总进度,确认是否仍有待执行或评估失败的项目。
- 查看综合均分,并结合各评估器“计入数量/总数量”判断本次覆盖范围。
- 在 Case 明细中查看每条样本的综合、结果和轨迹评分。
- 单击 详情进入 Trace 评测详情,对照任务输入、参考答案和实际输出阅读评估结论。
- 展开评估器卡片,查看评分点、证据和失败原因。
统计只纳入评估成功且产生数值分数的结果。失败、待执行及已完成但没有数值分数的结果都不按 0 分计入均分。因此,应同时看分数和“多少项真正计入”,不能只用较高均分代表所有样本评测成功。
处理评估失败
评估失败表示评分流程未正常产出结果,不等于被测 Agent 获得 0 分。阅读错误原因,检查模型连接和所需参考数据等条件,修复后使用 重评:
- Case 明细中的 重评会重试该 Case 下失败的评估结果。
- 单条详情中展开失败的评估器卡片,可针对该项执行 重评。
人工修正评分
已完成的评估结果支持 修正得分:
- 展开目标评估器卡片,单击 修正得分。
- 填写 0~100 的人工分和必填的修正理由。
- 单击 保存修正。
机器分会保留,统计改用人工分;页面记录修正人、时间和理由。可使用 撤销修正恢复机器分口径,重评会清除此人工修正。
向已有实验追加样本
在实验详情的 Case 明细右侧单击 + 新增 Case,选择其他 Trace 并按需标注参考答案,再单击 新增并评测。新增样本沿用该实验已经配置的评估器,提交后立即在后台评测。若既定评估器依赖参考答案,而新增样本未标注,该评估器不会产出可计入统计的有效分数。
第一次实验的验证方法
- 在已接入的 Agent 中执行一个易于人工核对的任务,例如询问“Linux 中如何查看当前工作目录?”。
- 在 链路追踪中确认任务已完成,输入正确,实际输出完整。
- 创建单组实验并仅选择这条 Trace。
- 在 预期答案中单击 标注,填写“执行 pwd 命令。”并单击 保存,确认 已标注后选择 结果准确性;也可只选不依赖参考答案的 答案质量先验证连接和流程。
- 单击 开始实验,确认详情中的完成数量变为 1,并进入该 Case 的详情查看分数和原因。
- 将评估器结论与实际输出人工对照。得分由模型判定,不要求固定为某个数值;先确认评测成功、有评分依据,再扩大样本规模。
常见问题
待评测 Agent 列表为空怎么办
确认当前账号对应的 Agent 已完成接入并有主 Trace 上报记录。先到 链路追踪查看该 Agent 的主 Trace,再返回新建实验;仅有子 Agent Trace 的 Agent 不在候选列表中。
只有数据集,没有 Trace,可以开始实验吗
普通单组实验至少选择一条已有 Trace。数据集可提供参考答案,但不会自动让 Agent 运行任务。监听模式允许零条样本开始,仍需要所选 Agent 后续上报符合条件的 Trace 才会有新结果。
实验均分很高,是否代表所有评测都成功
不能仅看均分。检查完成、失败、待执行数量,以及评估器的计入数量。失败或尚未产生分数的结果不计入均分。
可以在一个实验中对比两个模型或两个 Agent 框架吗
当前入口提供 无变量 · 单组实验。界面中的 LLM 对比、Agent 框架对比和 Skill 版本对比暂不可选择。