AI 应用不是崩是悄悄变差
AI 应用不是崩,是悄悄变差|业务决策 · 三期系列第二讲
本视频含 AI 生成内容(音频由 AI 合成,已按平台要求声明)。
项目交付完、验收通过、应用上线,双方都松了一口气。三个月后你再去问一句「最近用得怎么样」,得到的回答通常是「还行吧,没人反馈问题」。这句话听起来像好消息,其实是这个领域最典型的盲区。
AI 应用的劣化是慢性的、隐形的。它不像服务器宕机那样有人打电话找你,也不像接口报错那样留下红色记录——AI 应用最常见的故障形态不是崩,是悄悄变差。为什么看不出来?它不报错,缺陷流程照常成功、状态照常显示已完成;它没有对照组,没有基线就得不出来「变差」;后台展示的是流量,不是健康。
所以这件事需要一个固定动作:体检。检三层资产——服务器环境、应用本身(功能、异常、性能、安全、可靠性、压力六个维度)、以及应用背后的 Agent。判定靠参考范围不靠感觉:问题集通过率九成以上正常、低于七成五异常;误拒答率零正常;响应超过二十秒异常;运行失败率百分之三以内正常;备份超过十四天或根本没有,就是异常。健康分有一条关键规则:每个维度取最差的那一项,不是平均,因为一个异常项不该被一堆正常项稀释掉。
三个真实案例:四十四条问题集查出六条该答没答(手册里明明有答案,系统却说不在范围内,逐层取证才发现是意图分类节点解析失败走了兜底分支,而兜底与「真的不属于业务范围」共用同一句话术,一次系统故障被说成了「你没资格问」);同一个应用一千四百零一个段落里有三百四十一段结构残缺,占近四分之一,它不降低系统可用性,只降低答案质量;还有响应,九五分位达到四十二秒。有意思的是,这个应用的回答质量其实不错——质量不错和体验不合格,在同一个系统上同时成立。
最后是一条边界:诊断和修复是两件事,出报告的人的动机是把话说准,而不是让问题看起来很多。体检、修复、验收像一家医院里的三个科室,各自守的是说得准、修到位、敢上线。
- 00:00开场:AI 应用不是崩,是悄悄变差
- 00:37交付验收都通过了,三个月后问一句
- 01:29最常见的不是崩溃,是悄悄变差
- 01:57看不出来是结构问题:四个原因
- 03:43检什么:三层资产
- 04:16应用层的六个维度
- 05:18凭什么算有问题:参考范围
- 06:39健康分:取最差的一项,不取平均
- 07:31案例一:四十四条问题集,六条该答没答
- 08:36案例二:将近四分之一的知识库残片
- 09:10案例三:四十二秒的响应
- 10:47体检是循环:季度全检 + 月度快检
- 11:58体检和修复是两件事,像医院三个科室
- 14:01收尾:没人反馈问题的三种可能