Agent Insight 用户指南
Agent Insight 帮助用户记录 Agent 的执行过程,并通过评估器检查任务结果和执行轨迹。本手册介绍平台安装、Agent 接入、链路追踪和评测操作,适用于具备基本 Linux 操作知识的 Agent 开发者、测试人员和运维人员。
功能概览
平台提供以下功能:
| 导航入口 | 用途 |
|---|---|
| 运行观测 > 链路追踪 | 检索执行记录,查看调用树、时间线、输入输出和耗时,导入导出 Trace。 |
| 评测中心 > 实验 | 对已采集的 Trace 评分,查看明细、重试失败评估或人工修正评分。 |
| 评测中心 > 评测数据集 | 维护任务输入、参考答案和轨迹样本,复用评分所需的参考数据。 |
| 评测中心 > 评估器 | 查看预置评分规则,创建和管理自定义 LLM 评估器。 |
| 配置 > 模型注册 | 配置评测模型的连接信息并检查可用性。 |
| 配置 > 安装指导 | 获取当前账号的 AcTrail Linux 接入命令。 |
工作流程
- 管理员安装 Agent Insight,向用户提供可访问的平台地址。
- 用户登录平台,在实际运行 Agent 的主机上配置 AcTrail 数据上报。
- 用户运行一次 Agent 任务,在链路追踪中查看采集结果。
- 用户配置评测模型,选择已有 Trace、参考答案和评估器,创建评测实验。
- 用户对照原始输入输出检查评分依据,将典型样本保存为数据集。
采集和评测是两个独立环节。查看 Trace 不要求配置评测模型;创建普通实验需要已有 Trace,数据集不会自动驱动 Agent 重新执行任务。平台根据采集信息判断执行状态,“成功”不代表答案正确;评测得分是模型按指定规则作出的判断,需要结合原始记录理解。
平台安装内容
| 组成 | 所在位置 | 作用 |
|---|---|---|
| Agent Insight 服务端 | 平台服务器 | 接收数据、保存记录、提供页面并调用评测模型。 |
| SQLite 数据库 | 平台服务器的本地数据目录 | 保存执行记录、模型配置、数据集和评测结果。 |
管理员通过 RPM 安装平台,由 agent-insight.service 管理服务,用户通过浏览器访问。默认使用本地 SQLite 数据库,启动时自动初始化。安装步骤和数据路径见安装与维护。
接入准备
- 采集 Agent 数据:用户需在运行任务的主机上准备业务 Agent、AcTrail 和官方
otel-http插件,再配置向平台上报。AcTrail 与业务 Agent 属于接入侧环境,由使用方独立部署和配置。 - 进行模型评测:用户需准备可用的模型服务,并在平台中注册连接信息。
平台服务器与 Agent 主机可以是不同机器。Agent 主机需能访问平台地址;进行评测时,平台服务器需能访问模型服务。具体步骤见登录和接入 Agent和注册模型。
阅读顺序
| 目标 | 章节 |
|---|---|
| 部署和维护平台 | 安装与维护 |
| 用最短流程完成一次观测与评测 | 快速上手 |
| 配置账号与数据采集 | 登录和接入 Agent |
| 配置评分所需的模型 | 注册模型 |
| 分析一次执行的过程 | 链路追踪 |
| 整理样本和参考答案 | 管理评测数据集 |
| 选择或编写评分规则 | 管理评估器 |
| 运行并分析评测 | 运行评测实验 |
| 排查使用问题 | 常见问题 |
术语
| 术语 | 含义 |
|---|---|
| Agent | 接受任务、调用模型或工具并产生结果的程序。 |
| Trace | 一次执行的链路记录。 |
| Span | 链路中的执行节点,例如模型请求、工具调用。 |
| 子 Agent | 主 Agent 执行过程中派生的子任务 Agent。 |
| Tokens | 模型输入、输出的计量单位;是否有记录取决于采集数据。 |
| 参考答案 | 用户确认的预期结果,供依赖参考数据的评估器使用。 |
| 评估器 | 为实际输出或执行过程评分的规则。 |
| Case | 实验中的一条任务样本;可对应多个评估器结果。 |
| 接入 API Key | 将采集数据归属到平台账号的凭证,与模型服务 API 密钥不同。 |
问题反馈可通过 Agent Insight Issues 提交。
文档捉虫