Hermes Agent 调教实录(零):AI Agent 靠不靠谱?我用 200 次对照实验告诉你
基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)
📖 摘要:同一个模型,有人配的 Agent 指哪打哪,有人配的却脱缰野马。本文用 200 多次对照实验研究 Agent 配置——约束文件、记忆、技能、交付包、多轮对话,每一层都有实测数据和可复现的方法。系列八篇,从「AGENTS.md 怎么写」到「怎么验收」,给你一套可验证的配置方法论。
为什么写这个系列
做 AI 应用交付的这两年,我见过最多的场景不是「模型能力不行」,而是「同一个模型,换个人配就完全两个样」。
同一个 LLM,有人配出来的 Agent 指哪打哪:格式稳定、来源可查、写完自测;有人配出来的 Agent 像脱缰野马:答非所问、编造数据、反复返工。
差别在哪?大多数人归因于「提示词写得好不好」。但我们在交付实践中发现,答案远不止提示词——约束文件、记忆、技能、验收,每一层都在决定 Agent 的靠谱程度。
问题是:这些说法全是「经验之谈」。经验之谈最大的问题——你没法验证它,也没法反驳它。
所以我们决定换一种方式:用对照实验,把「Agent 配置」这件事变成可测量的数据。
我们做了什么
从 2026 年 8 月的一天开始,我们搭了一个实验体系:
实验载体:Hermes Agent v0.20.0(开源,官方文档可查),模型统一 deepseek-v4-flash
隔离环境:独立 profile(一个完全干净的 Agent 环境,不碰生产配置)
同一张考卷:4 个约束敏感型任务(格式转换 / 技能使用 / 报告写作 / 代码自测)——选这些任务是因为它们「无约束时 Agent 不会自觉做,有约束时 Agent 会遵守」,是配置效果的试金石
六维评估:一次成功率、达标率、自我修正次数、成本、稳定性、退化风险
对照组:每个实验都有「无配置」基线,跑完基线才开测变体
六个实验批次,累计 200+ 次 Agent 会话,覆盖:约束文件(AGENTS.md / SOUL / USER / MEMORY)、记忆管理、技能架构、交付包组装、多轮对话,最后在云端生产环境做了结论复现。
这套方法本身,你也能用
这个系列不只给结论,也给方法——怎么设计一个对照实验去验证「你的配置有没有用」。完整流程:
立考卷:选 4 个「无约束不自觉、有约束会遵守」的任务(本系列第一篇会给完整清单)
定基线:无配置先跑一遍,考卷自检通过才开测
跑对照:每个变体 N 任务 × 3 轮(模型有随机性,3 轮取稳定性)
控制变量:同任务、同模型、同会话模式——只改你要测的那一个变量
结论沉淀:每批结论带环境版本(Hermes v0.20.0),版本演进后旧结论可追溯
系列地图
| 序号 | 主题 | 回答的问题 |
|---|---|---|
| 零 | 系列总览与方法 | 为什么用对照实验研究 Agent 配置(本篇) |
| 一 | AGENTS.md 怎么写 | 约束文件怎么写,Agent 才真的听话? |
| 二 | 记忆怎么管 | 给 Agent 写记忆有什么学问? |
| 三 | 技能怎么写 | 技能怎么写,才不会被 Agent 无视? |
| 四 | 交付包怎么配 | 约束叠加到什么程度会翻车? |
| 五 | 多轮对话 | 和 Agent 聊 8 轮,怎么不跑偏? |
| 六 | 怎么验收 | 怎么证明一个 Agent 真的靠谱? |
| 七 | 七条铁律 | 200 次实验的结论汇总 |
先说三个最重要的发现
这个系列有 7 个结论,但如果你只记三条,记住这些:
结构化约束 > 裸铁律:同样写「先加载技能再动手」,写成带「要求/禁止」两列的纪律表,比一句话铁律效果好得多——达标率 100% vs 96.1%,成本反而更低
约束不是越多越好:四层约束全家桶叠加,成本涨到 2.66 倍,效果反而比单层结构化差——存在「甜点区」
多轮对话里,对话本身就是约束:Agent 会记住你前几轮提的要求并执行——但「技能检查」这类行为纪律,仍然要靠约束文件
这些结论全部来自实测数据,每一篇都有完整的实验设计和数据表,你可以自己复现。
源码与实验记录
本系列的实验记录、数据、模板全部可查:约束文件模板、记忆模板、技能架构判据、验收考卷——散落在各篇文章里,可直接复制使用。
系列第一篇,我们从最基础也最重要的开始:AGENTS.md 到底怎么写,Agent 才真的听话?
- Hermes Agent 技能治理实录:关掉自动审查,改用 git 审计 + 变更快照 + 每周自检三道防线(v0.20.4 实测)
- Hermes Agent 调教实录(零):AI Agent 靠不靠谱?我用 200 次对照实验告诉你
- Harness 的真相:落地不是框架,是一份 800 字的 AGENTS.md(36 次受控实验)
- Hermes Agent 调教实录(一):AGENTS.md 怎么写,AI Agent 才真的听话?
- Hermes Agent 调教实录(二):给 AI Agent 写记忆的学问——粒度、归属与时机实测
- Hermes Agent 调教实录(三):Agent 技能怎么写才不会被无视?——触发词与体积实测
- Hermes Agent 调教实录(四):AI Agent 交付包怎么配不翻车?——约束叠加的边界实测
- Hermes Agent 调教实录(五):和 AI Agent 多轮对话怎么不跑偏?——8 轮对话链实测
- Hermes Agent 调教实录(六):怎么验收一个 AI Agent?——考卷 + 六维评估实战
- Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总