管理评测数据集
评测数据集用于保存可重复使用的任务输入、参考答案和轨迹样本。创建实验时,可以使用数据集为已有 Trace 匹配参考答案。导入数据集不会自动驱动 Agent 执行任务。
前提条件
- 已登录 Agent Insight,并能打开 评测中心 > 评测数据集。
- 已准备任务输入;需要按参考答案评分时,已核实参考答案正确。
创建数据集
- 打开 评测中心 > 评测数据集。
- 单击 新建评测集。
- 输入名称,可填写描述。名称最长 50 个字符,描述最长 200 个字符。
- 选择场景:
- 理想输出评测集:默认包含输入和预期输出。
- 轨迹评测集:额外包含执行轨迹。
- 单击 保存评测集,进入该数据集的数据项页面。
- 单击 单个添加录入样本,或使用 批量导入。
参考输出不是保存每条样本的必填字段,但依赖参考答案的评估器需要它。如果准备在实验中匹配参考答案,请确保样本的输入与 Trace 的任务输入一致,参考输出填写经过确认的正确答案。
批量导入
- 打开目标数据集,单击 批量导入。
- 选择 JSON / CSV 文本粘贴内容,或选择 文件上传上传
.json、.csv、.txt文件。 - 单击 开始导入。
- 核对数据项数量,并抽查输入和预期输出是否落在正确列。
导入会追加到已有数据项。重复导入同一文件会追加样本,请在确认内容后导入一次。
推荐使用 JSON 数组,基本格式如下:
[
{
"input": "Linux 中如何查看当前工作目录?",
"reference_output": "执行 pwd 命令。"
},
{
"input": "Linux 中如何列出当前目录的文件?",
"reference_output": "执行 ls 命令。"
}
]简单的单行样本也可使用 CSV:
input,reference_output
Linux 中如何查看当前工作目录?,执行 pwd 命令。
Linux 中如何列出当前目录的文件?,执行 ls 命令。| 字段 | 含义 | 支持的常用别名 |
|---|---|---|
input | 任务输入 | question、prompt、query |
reference_output | 参考输出/预期答案 | expected_output、expectedOutput、output |
trajectory | 轨迹评测集中的执行过程文本 | trace、agent_trace |
CSV 带表头时应同时提供输入与预期输出列;预期输出的单元格可以为空。无表头时,前两列依次为输入和预期输出,轨迹评测集的第三列为轨迹。文本包含换行、引号或复杂轨迹时,使用 JSON 数组;轨迹内容在当前批量导入中填写为 JSON 字符串,或直接从链路追踪回流,避免手工转写。
不要将 JSONL 当作 JSON 数组上传。数据项页的批量导入主要识别上述核心字段;业务自定义字段可通过 新增字段后,在单条数据项的编辑窗口中补充。
维护样本和字段
- 使用 编辑修正单条样本,使用 删除移除无效样本。
- 使用 新增字段添加文本、数字、布尔值或 JSON 字段。字段名称在同一数据集中不能重复,内部标识由系统生成。
- 新增字段不会自动补齐已有样本,需在样本编辑窗口填写。
- 数字字段填写有效数字,JSON 字段填写有效 JSON;保存前会检查格式。
- 删除整个数据集前确认其中样本无需保留。
从真实 Trace 积累样本
链路追踪提供 加入评测集操作,可将任务输入、实际输出和原始轨迹映射到数据集字段。把实际输出作为参考答案前应由用户核实内容正确,错误答案不宜直接作为后续评分基准。在链路追踪详情中单击 加入评测集,选择已有数据集或创建数据集,核对字段映射和最终数据预览后确认加入。保存后返回数据集,检查新增样本的输入、参考输出和轨迹。
验证结果
- 新建数据集后,能在数据项页面看到正确的名称和字段。
- 将本章两条 JSON 样本导入空数据集后,列表应有两条数据,输入与参考输出与示例一致。CSV 示例是相同的两条样本,选择一种格式即可,不要把两种格式重复导入同一数据集。
- 编辑一条参考输出并保存,刷新后仍能看到修改后的内容。
常见问题
为什么实验从数据集匹配参考答案时显示未匹配
匹配要求任务输入去除首尾空白后完全一致,不采用相似度匹配。检查正文中的标点、换行、空格是否一致,参考输出是否为空。已人工标注的参考答案不会被覆盖。
为什么导入后数据项内容错列或多出行
检查 CSV 的表头和列顺序。包含换行、双引号或复杂内容的样本,使用 JSON 数组并正确转义字符串。导入后抽查内容;如已误导入,先删除错误数据项,再重新导入正确内容。