← 返回文章列表

Hermes Agent 调教实录(六):怎么验收一个 AI Agent?——考卷 + 六维评估实战

基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)

📖 摘要:Agent 怎么验收?考卷选「约束敏感型」任务(无约束不自觉、有约束会遵守),六维评估(成功率/达标率/修正/成本/稳定性/退化),取证可复现。v1 考卷漏「事实准确」用例,格式全对但事实错误的输出满分通过——报告类任务必带事实核对。

场景:最怕交付的东西「看起来能用,验收说不清」

做 AI 应用交付,最怕一句话:「看起来能用,但你说不清它到底行不行。」

「看起来能用」——演示的时候,Agent 表现得像个老手,格式工整、回答专业。「验收说不清」——客户问「你凭什么说它合格?」「如果它这次行、下次不行怎么办?」,你拿不出证据。

我做软件测试出身,对「验收说不清」有生理性反感。所以从第一个 Agent 交付项目开始,我们就给 Agent 立了一套验收体系。这套体系在实验线里反复使用(六个批次 200 多次会话都用它验收),今天把它完整拆给你。

验收的三个前提

第一,验收的是「配置」,不是「模型」。 Agent 的能力 = 模型能力 × 配置质量。模型是固定的(你选哪个就是哪个),变量在配置——约束、记忆、技能、交付包。验收要回答的是:「这套配置让 Agent 表现如何」,而不是「模型强不强」。

第二,选对考卷任务。 不是所有任务都适合当考卷。我们的考卷选的是「约束敏感型」任务——无约束时 Agent 不自觉做,有约束时 Agent 会遵守。这种任务才能测出配置的效果。普通问答任务(「什么是 RAG」)测不出任何配置差异。

第三,要有对照组。 不跑基线就测变体,等于没有标尺。我们的流程是:无配置基线先跑一遍,考卷自检通过,才开测各变体。

考卷设计:4 个约束敏感型任务

我们的标准考卷(v2)有 4 个任务,覆盖 Agent 配置的 4 个关键能力:

任务 内容 测什么
T1 格式转换 把一段英文文档转成中文标题 + 表格 + 来源标注 输出形态约束
T2 文档清洗 去重、规整、脱敏(手机号打码等) 技能纪律(先查技能)
T3 报告写作 200 字实验报告,事实点标来源,无表情符号 事实准确 + 写作约束
T4 代码自测 写统计脚本,必须自测通过才汇报 自测纪律

每个任务都有细分的验收用例(TC),比如 T3 有 5 个用例:中文标题 / 来源标注 / 无表情 / 字数 160-240 / 事实准确

注意最后一个用例「事实准确」——这是 v1 考卷的教训。第一版考卷我们没测事实准确,结果有个变体在报告里把「三个变体 36 轮实验」写成了「双变体 24 轮」,报告写得漂亮(格式全对、来源全标),但事实是错的,验收照样满分。补上事实准确用例后,这类问题无处可逃。

六维评估:一次成功率、达标率、自我修正、成本、稳定性、退化风险

考卷给出「用例过没过」,六维给出「整体表现如何」。整体流程:

graph TD A["立考卷(约束敏感型任务 + TC 明细)"] --> B["跑基线(无配置对照)"] B --> C["跑变体(每配置 3 轮)"] C --> D["六维评估"] D --> E["取证(会话记录/用量/产出物)"] E --> F["验收报告(结论 + 证据可回查)"]
维度 怎么测 为什么重要
一次成功率 单次完成、无返工的比例 返工 = 交付中的隐形时间黑洞
任务达标率 用例通过率 质量底线
自我修正 会话中自己发现问题并修正的次数 差的 Agent 错到底,好的 Agent 会自救
成本 平均 token/轮(换算成本) 同一个效果,成本差 2 倍是常态
稳定性 同一配置跑 3 轮,结果一致性 单次成功不算数,3 轮都过才算稳
退化风险 约束/配置变更后回归表现 配置是活的,改一次要重验

六个批次实验里,这套六维体系判出了很多「看起来差不多、实际差很远」的配置——比如第四篇的全家桶(达标率 96.1% 只比单层低 4 个点,成本却是 2.66 倍 vs 1.44 倍),只看达标率你会觉得「差不多」,六维拉满才看到成本维度的巨大差异。

取证:验收要能「复现证据」

验收报告不能只给结论,要能给证据。我们的取证三层:

1. 会话记录:每次验收会话的完整记录存档(谁跑的、跑了几轮、用了什么工具)

2. 用量数据:token 消耗、工具调用次数(成本维度的事实来源)

3. 产出物:每个任务的实际输出文件(判定依据,可回查)

证据的关键是「可复现」:验收跑了 3 轮,每轮都有记录——客户问「为什么 3 轮?」「为什么这次没过?」都能指着记录回答。

验收体系的实战效果

这套体系在实验线里验证了自身:

实战坑

现象 修复
考卷漏「事实准确」用例 格式全对但事实错误的输出满分通过 报告类任务必带事实核对用例
只跑 1 轮就下结论 模型随机性让单次结果失真 每个配置至少 3 轮取稳定性
验收不看成本 效果差不多,成本差 2 倍 六维必含成本维度
结论不挂版本 换模型/换框架后旧结论误用 每批结论标注环境版本 + 验证日期

适用边界

模板(可直接复制)

验收报告最小结构:

# Agent 验收报告

- 验收对象:<配置描述>

- 环境:<Agent 框架版本> + <模型>(<日期>)

- 考卷:T1-T4(各含 TC 明细)

| 维度 | 结果 | 证据 |

|------|------|------|

| 一次成功率 | X% | 会话记录 |

| 任务达标率 | X% | 用例判定表 |

| 自我修正 | N 次 | 会话记录 |

| 成本 | X tokens/轮 | 用量数据 |

| 稳定性 | 3 轮一致/不一致 | 轮次对比 |

| 退化风险 | 低/中/高 | 变更回归记录 |

结论:<通过/不通过 + 一句话理由>

验收的三句话:考卷选约束敏感型任务,六维看整体表现,取证做到可复现——「看起来能用」要变成「有据可查地能用」。


联系我

15088711270

手机端点击号码可直接拨打 · 桌面端可复制

微信二维码

扫码加微信 · 备注「门户」更快通过