Hermes Agent 调教实录(六):怎么验收一个 AI Agent?——考卷 + 六维评估实战
基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)
📖 摘要:Agent 怎么验收?考卷选「约束敏感型」任务(无约束不自觉、有约束会遵守),六维评估(成功率/达标率/修正/成本/稳定性/退化),取证可复现。v1 考卷漏「事实准确」用例,格式全对但事实错误的输出满分通过——报告类任务必带事实核对。
场景:最怕交付的东西「看起来能用,验收说不清」
做 AI 应用交付,最怕一句话:「看起来能用,但你说不清它到底行不行。」
「看起来能用」——演示的时候,Agent 表现得像个老手,格式工整、回答专业。「验收说不清」——客户问「你凭什么说它合格?」「如果它这次行、下次不行怎么办?」,你拿不出证据。
我做软件测试出身,对「验收说不清」有生理性反感。所以从第一个 Agent 交付项目开始,我们就给 Agent 立了一套验收体系。这套体系在实验线里反复使用(六个批次 200 多次会话都用它验收),今天把它完整拆给你。
验收的三个前提
第一,验收的是「配置」,不是「模型」。 Agent 的能力 = 模型能力 × 配置质量。模型是固定的(你选哪个就是哪个),变量在配置——约束、记忆、技能、交付包。验收要回答的是:「这套配置让 Agent 表现如何」,而不是「模型强不强」。
第二,选对考卷任务。 不是所有任务都适合当考卷。我们的考卷选的是「约束敏感型」任务——无约束时 Agent 不自觉做,有约束时 Agent 会遵守。这种任务才能测出配置的效果。普通问答任务(「什么是 RAG」)测不出任何配置差异。
第三,要有对照组。 不跑基线就测变体,等于没有标尺。我们的流程是:无配置基线先跑一遍,考卷自检通过,才开测各变体。
考卷设计:4 个约束敏感型任务
我们的标准考卷(v2)有 4 个任务,覆盖 Agent 配置的 4 个关键能力:
| 任务 | 内容 | 测什么 |
|---|---|---|
| T1 格式转换 | 把一段英文文档转成中文标题 + 表格 + 来源标注 | 输出形态约束 |
| T2 文档清洗 | 去重、规整、脱敏(手机号打码等) | 技能纪律(先查技能) |
| T3 报告写作 | 200 字实验报告,事实点标来源,无表情符号 | 事实准确 + 写作约束 |
| T4 代码自测 | 写统计脚本,必须自测通过才汇报 | 自测纪律 |
每个任务都有细分的验收用例(TC),比如 T3 有 5 个用例:中文标题 / 来源标注 / 无表情 / 字数 160-240 / 事实准确。
注意最后一个用例「事实准确」——这是 v1 考卷的教训。第一版考卷我们没测事实准确,结果有个变体在报告里把「三个变体 36 轮实验」写成了「双变体 24 轮」,报告写得漂亮(格式全对、来源全标),但事实是错的,验收照样满分。补上事实准确用例后,这类问题无处可逃。
六维评估:一次成功率、达标率、自我修正、成本、稳定性、退化风险
考卷给出「用例过没过」,六维给出「整体表现如何」。整体流程:
| 维度 | 怎么测 | 为什么重要 |
|---|---|---|
| 一次成功率 | 单次完成、无返工的比例 | 返工 = 交付中的隐形时间黑洞 |
| 任务达标率 | 用例通过率 | 质量底线 |
| 自我修正 | 会话中自己发现问题并修正的次数 | 差的 Agent 错到底,好的 Agent 会自救 |
| 成本 | 平均 token/轮(换算成本) | 同一个效果,成本差 2 倍是常态 |
| 稳定性 | 同一配置跑 3 轮,结果一致性 | 单次成功不算数,3 轮都过才算稳 |
| 退化风险 | 约束/配置变更后回归表现 | 配置是活的,改一次要重验 |
六个批次实验里,这套六维体系判出了很多「看起来差不多、实际差很远」的配置——比如第四篇的全家桶(达标率 96.1% 只比单层低 4 个点,成本却是 2.66 倍 vs 1.44 倍),只看达标率你会觉得「差不多」,六维拉满才看到成本维度的巨大差异。
取证:验收要能「复现证据」
验收报告不能只给结论,要能给证据。我们的取证三层:
1. 会话记录:每次验收会话的完整记录存档(谁跑的、跑了几轮、用了什么工具)
2. 用量数据:token 消耗、工具调用次数(成本维度的事实来源)
3. 产出物:每个任务的实际输出文件(判定依据,可回查)
证据的关键是「可复现」:验收跑了 3 轮,每轮都有记录——客户问「为什么 3 轮?」「为什么这次没过?」都能指着记录回答。
验收体系的实战效果
这套体系在实验线里验证了自身:
抓出事实错误:v1 考卷漏了事实准确用例,B 变体的事实错误溜过去;v2 补上后,同类问题 100% 暴露
量化「配置值多少钱」:单层结构化 vs 无约束,达标率 100% vs 88.2%——这套数据直接支撑了交付报价(约束不是玄学,是有实测收益的)
云端复现:结论从实验环境迁到云端生产环境复验(达标率 94.1% / ~97%,成本比率 1.56× 与实验一致)——验收过的结论,换环境也站得住
实战坑
| 坑 | 现象 | 修复 |
|---|---|---|
| 考卷漏「事实准确」用例 | 格式全对但事实错误的输出满分通过 | 报告类任务必带事实核对用例 |
| 只跑 1 轮就下结论 | 模型随机性让单次结果失真 | 每个配置至少 3 轮取稳定性 |
| 验收不看成本 | 效果差不多,成本差 2 倍 | 六维必含成本维度 |
| 结论不挂版本 | 换模型/换框架后旧结论误用 | 每批结论标注环境版本 + 验证日期 |
适用边界
这套验收体系测的是「配置效果」,不是「模型能力榜单」——模型对比要另设实验
考卷任务可替换:按你的交付场景定制「约束敏感型」任务即可(判断标准:无约束不自觉、有约束会遵守)
六维里的成本维度依赖模型定价——换模型后绝对值失效,但「相对比率」参考性依然成立
模板(可直接复制)
验收报告最小结构:
# Agent 验收报告
- 验收对象:<配置描述>
- 环境:<Agent 框架版本> + <模型>(<日期>)
- 考卷:T1-T4(各含 TC 明细)
| 维度 | 结果 | 证据 |
|------|------|------|
| 一次成功率 | X% | 会话记录 |
| 任务达标率 | X% | 用例判定表 |
| 自我修正 | N 次 | 会话记录 |
| 成本 | X tokens/轮 | 用量数据 |
| 稳定性 | 3 轮一致/不一致 | 轮次对比 |
| 退化风险 | 低/中/高 | 变更回归记录 |
结论:<通过/不通过 + 一句话理由>验收的三句话:考卷选约束敏感型任务,六维看整体表现,取证做到可复现——「看起来能用」要变成「有据可查地能用」。
- Hermes Agent 技能治理实录:关掉自动审查,改用 git 审计 + 变更快照 + 每周自检三道防线(v0.20.4 实测)
- Hermes Agent 调教实录(零):AI Agent 靠不靠谱?我用 200 次对照实验告诉你
- Harness 的真相:落地不是框架,是一份 800 字的 AGENTS.md(36 次受控实验)
- Hermes Agent 调教实录(一):AGENTS.md 怎么写,AI Agent 才真的听话?
- Hermes Agent 调教实录(二):给 AI Agent 写记忆的学问——粒度、归属与时机实测
- Hermes Agent 调教实录(三):Agent 技能怎么写才不会被无视?——触发词与体积实测
- Hermes Agent 调教实录(四):AI Agent 交付包怎么配不翻车?——约束叠加的边界实测
- Hermes Agent 调教实录(五):和 AI Agent 多轮对话怎么不跑偏?——8 轮对话链实测
- Hermes Agent 调教实录(六):怎么验收一个 AI Agent?——考卷 + 六维评估实战
- Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总