← 返回文章列表

Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总

基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)

📖 摘要:200 多次实验的结论汇总成七条铁律:结构化约束、纪律进身份、记忆粗粒度、触发词精准窄、小技能单文件大技能拆 refs、约束有甜点区、验收用考卷+六维。每条带实测数据和适用边界,可直接复制使用。

为什么要有「铁律」

六篇文章,六个主题:约束、记忆、技能、交付包、多轮、验收。每篇都有实验数据、都有适用边界——但真到交付现场,你不会带着六篇文章干活。你需要的是几条能直接用的判断。

所以最后一篇,把 200 多次对照实验的结论压成七条铁律。每条都带「为什么」和「什么时候不适用」——铁律不是教条,是有边界的经验。

七条铁律

铁律一:结构化约束 > 裸铁律

内容:约束文件写成分节 + 纪律表格(要求/禁止成对),不要写一句话铁律。

数据:结构化写法达标率 100%、成本 1.44×;裸铁律达标率 96.1%、成本 2.28×,还出过事实错误。

为什么:只写要求不写禁止,Agent 会把要求「字面执行」成过度行为。

不适用:任务极简单(无纪律要求)时,两种写法没差别。

铁律二:纪律放身份层,信息放记忆层

内容:行为纪律(先查技能/写完自测)写进身份文件(SOUL),环境事实/偏好写进记忆(MEMORY)。

数据:同一条「先加载技能」,身份文件触发 3/3,记忆文件只触发 1-2/3。

为什么:记忆是「参考信息」,身份是「自我要求」——Agent 对两者的执行强度完全不同。

不适用:一次性任务(不跨会话)时,记忆层纪律的弱触发影响不大。

铁律三:记忆默认粗粒度,细节按需补

内容:记忆先写 5 条左右一句话偏好,不要一上来写 10 条分类细节。

数据:粗粒度记忆成本 0.80×(比不写还省),细结构化 1.24× 只换来 +4% 达标率。

为什么:粗粒度给了方向感减少探索,细粒度在一般任务上边际收益递减。

不适用:高度依赖具体规范的任务(行业术语/字段规范),细粒度必要。

铁律四:触发词精准窄,技能名当门面

内容:技能描述只写真实场景触发词;技能命名要直观表达能力。

数据:宽触发词让弱相关任务 3/3 误加载;模糊描述挡不住正主加载(技能名本身就是信号)。

为什么:Agent 先看「技能名 + 描述」决定加载与否——误加载浪费上下文,命名差则正主也不加载。

不适用:技能库很小(<10 个)时,误加载成本可接受。

铁律五:小技能单文件,大技能拆 refs

内容:≤25KB 技能全写一个文件;>50KB 拆成骨架 + 细节文件。

数据:1.4KB 技能拆 refs 成本 1.29×(负优化);77KB 大技能拆 refs 省 13.5% 输入 token(58.5k → 50.6k)。

为什么:小技能拆了多一次加载往返;大技能单文件一次加载不完要反复读。

不适用:25-50KB 的技能按内容形态判断(查表型拆、方法论留)。

铁律六:约束有甜点区,交付包按形态选配

内容:约束 1-2 层结构化是甜点(1.4-1.7×,100% 达标);全家桶过载(2.66×,纪律稀释)。交付按形态分档:多轮配纪律层 + 记忆,单轮配全套。

数据:单层结构化 1.44×/100%;三层组合 1.66×/100%;四层全家桶 2.66×/96.1%。

为什么:约束本质是上下文指令,指令越多注意力越分散,层间还可能冲突。

不适用:客户明确要求全配置矩阵时(极少数合规场景),过载成本要提前报给客户。

铁律七:验收用考卷 + 六维 + 取证

内容:考卷选约束敏感型任务;六维评估(一次成功率/达标率/自我修正/成本/稳定性/退化风险);证据可复现。

数据:v1 考卷漏「事实准确」用例,事实错误输出满分通过;v2 补上后 100% 暴露。云端复现确认结论跨环境可迁移(达标率 94.1% / ~97% 一致)。

为什么:没有验收 = 没有「合格」的定义,交付说不清。

不适用:纯内部实验(不对外交付)时,验收可以简化到只跑考卷。

结论汇总表

配置决策的总入口,一张图:

graph TD START["交付一个 Agent"] --> FORM{"交付形态?"} FORM -->|"多轮对话(IM 接入)"| M1["纪律层 + 记忆(输出靠对话)"] FORM -->|"单轮自动化"| M2["全套(纪律 + 输出格式)"] M1 --> SK["技能层(1-2 个,精准触发词)"] M2 --> SK SK --> ACC["验收(考卷 + 六维 + 取证)"] ACC --> DONE{"达标?"} DONE -->|"是"| OK["交付(版本锁定)"] DONE -->|"否"| FIX["按铁律 1-6 定位修复"] FIX --> ACC
# 铁律 核心数据 一句话
1 结构化 > 裸铁律 100% vs 96.1%,1.44× vs 2.28× 要求/禁止成对写
2 纪律进身份,信息进记忆 触发 3/3 vs 1-2/3 记忆是参考,身份是要求
3 记忆粗粒度起步 0.80× vs 1.24× 5 条一句话起步
4 触发词精准窄 误加载 3/3 vs 0/3 技能名当门面
5 体积分界 25/50KB 1.29× vs 省 13.5% 小不拆,大拆
6 甜点区 + 形态分档 1.4-1.7× vs 2.66× 别全家桶
7 考卷 + 六维 + 取证 事实用例补漏 可复现地能用

这套方法的边界(诚实版)

这套铁律来自 200 多次会话,但有几件事我们还没测:

欢迎用你手上的 Agent 框架复现这套方法——方法比结论更通用:立考卷、定基线、跑对照、取六维。如果复现结果和我们不一样,欢迎来评论区对账,那正是这个系列存在的意义。

系列完结

从「AGENTS.md 怎么写」到「怎么验收」,七篇文章、200 多次实验——我们把「AI Agent 配置」从经验之谈变成了可测量的数据。

本系列的核心资产(全部可直接复制):

后续我们会在真实交付中继续验证和补充这些结论(尤其是长对话退化边界),有新数据会在评论区/后续文章同步。


联系我

15088711270

手机端点击号码可直接拨打 · 桌面端可复制

微信二维码

扫码加微信 · 备注「门户」更快通过