Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总
基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)
📖 摘要:200 多次实验的结论汇总成七条铁律:结构化约束、纪律进身份、记忆粗粒度、触发词精准窄、小技能单文件大技能拆 refs、约束有甜点区、验收用考卷+六维。每条带实测数据和适用边界,可直接复制使用。
为什么要有「铁律」
六篇文章,六个主题:约束、记忆、技能、交付包、多轮、验收。每篇都有实验数据、都有适用边界——但真到交付现场,你不会带着六篇文章干活。你需要的是几条能直接用的判断。
所以最后一篇,把 200 多次对照实验的结论压成七条铁律。每条都带「为什么」和「什么时候不适用」——铁律不是教条,是有边界的经验。
七条铁律
铁律一:结构化约束 > 裸铁律
内容:约束文件写成分节 + 纪律表格(要求/禁止成对),不要写一句话铁律。
数据:结构化写法达标率 100%、成本 1.44×;裸铁律达标率 96.1%、成本 2.28×,还出过事实错误。
为什么:只写要求不写禁止,Agent 会把要求「字面执行」成过度行为。
不适用:任务极简单(无纪律要求)时,两种写法没差别。
铁律二:纪律放身份层,信息放记忆层
内容:行为纪律(先查技能/写完自测)写进身份文件(SOUL),环境事实/偏好写进记忆(MEMORY)。
数据:同一条「先加载技能」,身份文件触发 3/3,记忆文件只触发 1-2/3。
为什么:记忆是「参考信息」,身份是「自我要求」——Agent 对两者的执行强度完全不同。
不适用:一次性任务(不跨会话)时,记忆层纪律的弱触发影响不大。
铁律三:记忆默认粗粒度,细节按需补
内容:记忆先写 5 条左右一句话偏好,不要一上来写 10 条分类细节。
数据:粗粒度记忆成本 0.80×(比不写还省),细结构化 1.24× 只换来 +4% 达标率。
为什么:粗粒度给了方向感减少探索,细粒度在一般任务上边际收益递减。
不适用:高度依赖具体规范的任务(行业术语/字段规范),细粒度必要。
铁律四:触发词精准窄,技能名当门面
内容:技能描述只写真实场景触发词;技能命名要直观表达能力。
数据:宽触发词让弱相关任务 3/3 误加载;模糊描述挡不住正主加载(技能名本身就是信号)。
为什么:Agent 先看「技能名 + 描述」决定加载与否——误加载浪费上下文,命名差则正主也不加载。
不适用:技能库很小(<10 个)时,误加载成本可接受。
铁律五:小技能单文件,大技能拆 refs
内容:≤25KB 技能全写一个文件;>50KB 拆成骨架 + 细节文件。
数据:1.4KB 技能拆 refs 成本 1.29×(负优化);77KB 大技能拆 refs 省 13.5% 输入 token(58.5k → 50.6k)。
为什么:小技能拆了多一次加载往返;大技能单文件一次加载不完要反复读。
不适用:25-50KB 的技能按内容形态判断(查表型拆、方法论留)。
铁律六:约束有甜点区,交付包按形态选配
内容:约束 1-2 层结构化是甜点(1.4-1.7×,100% 达标);全家桶过载(2.66×,纪律稀释)。交付按形态分档:多轮配纪律层 + 记忆,单轮配全套。
数据:单层结构化 1.44×/100%;三层组合 1.66×/100%;四层全家桶 2.66×/96.1%。
为什么:约束本质是上下文指令,指令越多注意力越分散,层间还可能冲突。
不适用:客户明确要求全配置矩阵时(极少数合规场景),过载成本要提前报给客户。
铁律七:验收用考卷 + 六维 + 取证
内容:考卷选约束敏感型任务;六维评估(一次成功率/达标率/自我修正/成本/稳定性/退化风险);证据可复现。
数据:v1 考卷漏「事实准确」用例,事实错误输出满分通过;v2 补上后 100% 暴露。云端复现确认结论跨环境可迁移(达标率 94.1% / ~97% 一致)。
为什么:没有验收 = 没有「合格」的定义,交付说不清。
不适用:纯内部实验(不对外交付)时,验收可以简化到只跑考卷。
结论汇总表
配置决策的总入口,一张图:
| # | 铁律 | 核心数据 | 一句话 |
|---|---|---|---|
| 1 | 结构化 > 裸铁律 | 100% vs 96.1%,1.44× vs 2.28× | 要求/禁止成对写 |
| 2 | 纪律进身份,信息进记忆 | 触发 3/3 vs 1-2/3 | 记忆是参考,身份是要求 |
| 3 | 记忆粗粒度起步 | 0.80× vs 1.24× | 5 条一句话起步 |
| 4 | 触发词精准窄 | 误加载 3/3 vs 0/3 | 技能名当门面 |
| 5 | 体积分界 25/50KB | 1.29× vs 省 13.5% | 小不拆,大拆 |
| 6 | 甜点区 + 形态分档 | 1.4-1.7× vs 2.66× | 别全家桶 |
| 7 | 考卷 + 六维 + 取证 | 事实用例补漏 | 可复现地能用 |
这套方法的边界(诚实版)
这套铁律来自 200 多次会话,但有几件事我们还没测:
长对话退化:8 轮内无退化是实测,20-50 轮的边界未知(交付中观察中)
模型差异:全部实验基于 deepseek-v4-flash;换模型后成本绝对值变,相对比率可参考
框架差异:实验载体是 Hermes Agent(开源);其他框架的约束注入/记忆机制不同,阈值要实测
任务类型:考卷是 4 个约束敏感型任务;纯创作类/纯检索类任务的配置结论可能不同
欢迎用你手上的 Agent 框架复现这套方法——方法比结论更通用:立考卷、定基线、跑对照、取六维。如果复现结果和我们不一样,欢迎来评论区对账,那正是这个系列存在的意义。
系列完结
从「AGENTS.md 怎么写」到「怎么验收」,七篇文章、200 多次实验——我们把「AI Agent 配置」从经验之谈变成了可测量的数据。
本系列的核心资产(全部可直接复制):
AGENTS.md 结构化模板(第一篇)
粗粒度记忆模板(第二篇)
技能描述范式 + 体积判据(第三篇)
交付包分档配置(第四篇)
多轮交付三件事(第五篇)
验收报告模板(第六篇)
后续我们会在真实交付中继续验证和补充这些结论(尤其是长对话退化边界),有新数据会在评论区/后续文章同步。
- Hermes Agent 技能治理实录:关掉自动审查,改用 git 审计 + 变更快照 + 每周自检三道防线(v0.20.4 实测)
- Hermes Agent 调教实录(零):AI Agent 靠不靠谱?我用 200 次对照实验告诉你
- Harness 的真相:落地不是框架,是一份 800 字的 AGENTS.md(36 次受控实验)
- Hermes Agent 调教实录(一):AGENTS.md 怎么写,AI Agent 才真的听话?
- Hermes Agent 调教实录(二):给 AI Agent 写记忆的学问——粒度、归属与时机实测
- Hermes Agent 调教实录(三):Agent 技能怎么写才不会被无视?——触发词与体积实测
- Hermes Agent 调教实录(四):AI Agent 交付包怎么配不翻车?——约束叠加的边界实测
- Hermes Agent 调教实录(五):和 AI Agent 多轮对话怎么不跑偏?——8 轮对话链实测
- Hermes Agent 调教实录(六):怎么验收一个 AI Agent?——考卷 + 六维评估实战
- Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总