AI Agent 的 Harness到底是什么
约束与能力边界|技术类 · 同行向
本视频含 AI 生成内容(音频由 AI 合成,已按平台要求声明)。
管住 AI,靠的到底是什么?圈子里这两年冒出来一个词,叫 Harness,直译过来是「马具」——OpenAI 说推理模型是大脑、Harness 是手和脚;Terraform 的作者说得更朴素:每次 AI 犯一次错,就工程化一个方案,让它再也犯不了同样的错。
但概念听多了会冒出一个尴尬的问题:它到底是个「什么东西」?我们踩过的坑,一半来自把它错认成别的东西——它不是框架(没有安装动作、没有版本号)、不是平台(那是「跑在哪里」,不是「被什么管着」)、不是提示词(说一次就飘走,而约束文件每次启动都重新加载)、也不是一份规则清单。
这期给出一个能落到工程上的定义:Harness 是围绕 AI 做决定的三个时刻——决策前、执行中、出错后——划出的约束与能力边界。再拿一个真实在用的 AI 助手当样本,拆开看它的五层(约束 / 身份 / 能力 / 记忆 / 执行约束)。
然后是 36 次受控实验照出的四个机制:约束靠「加载」生效而不是靠「记住」;只写要求 AI 会把要求推向极端,要求加禁止才会收敛(成本从 2.28 倍降到 1.44 倍);同样的纪律放在不同层,触发强度差一个量级(1.59 倍 vs 2.28 倍);事实的完整性只能靠显式禁止和强制核对完整来源,靠提醒没用。
最后诚实划边界:它管不住模型的能力上限、管不住概率性失效、也管不住没说出口的需求。结论是——Harness 回答的从来不是「AI 能不能更聪明」,而是「AI 能不能更可靠」。在真实交付里,后者往往比前者值钱。
完整文字版见下方文章。
- 00:00开场:AI 答应得很好,做出来却是另一个样子
- 00:17为什么 AI 总在「自己发挥」
- 00:55Harness 是什么:马具、缰绳,和一句朴素的说法
- 02:07先划边界:它不是框架、不是平台、不是提示词
- 03:32本质:围绕决策的三个时刻划边界
- 04:47五层结构:约束 / 身份 / 能力 / 记忆 / 执行约束
- 06:0836 次受控实验:约束为什么生效(四个机制)
- 10:15落地:约束文件该怎么写(六条)
- 11:35边界诚实:它管不住什么
- 12:48结论:可靠比聪明值钱,它是缰绳不是引擎