AI 值守(二):盯什么才叫盯住了——巡检清单怎么定
📖 摘要:监控工具装了一堆,天天收到一堆「异常」,最后没人看——这不是监控的问题,是清单的问题。巡检清单不是拍脑袋列的,每一项背后都要有一个「不盯它会怎样」的理由。本文讲我们怎么定巡检清单:四类检查(可达性、内容、证书时效、资源水位),每类盯什么、阈值怎么设、怎么把噪音压到最低。附真实清单与阈值,可直接照着抄。
一、监控装上了,消息没人看
给网站配监控,第一周很兴奋:哇,有告警了!第二周开始烦:怎么老有告警?第三周:把通知关了吧。
这个剧本太常见了。问题出在哪?出在清单——什么都在盯,等于什么都没盯住。端口有几十个,页面有几十张,证书有一堆,服务器有一群——全盯,阈值乱设,结果就是告警刷屏,真出事的那条淹没在噪音里。
监控的成败,一半在清单。清单定得好:告警一年没几条,每一条都值得处理。清单定得烂:一天几十条,最后所有人学会忽略它。
二、定清单的第一原则:每一项都要回答「不盯它会怎样」
我们定巡检清单时用的过滤器:这一项如果坏了,会发生什么?发现得晚的代价有多大?
按这个过滤器,检查项分成四类:
| 类别 | 盯什么 | 「不盯它会怎样」 | 典型阈值 |
|---|---|---|---|
| 可达性 | 网站/服务能不能打开,服务器端口通不通 | 网站挂了没人知道,客户投诉你才知道 | HTTP 必须 200;端口必须开放 |
| 内容正确 | 页面关键内容在不在 | 被黑挂马、被改页面,访问者看到错误内容,你还在正常营业 | 关键特征文本必须存在 |
| 证书时效 | SSL 证书剩余天数 | 证书到期当天浏览器报「不安全」,流量断崖 | >30 天正常;≤30 天提醒;≤7 天告警 |
| 资源水位 | 磁盘空间、关键服务状态(需服务器权限) | 磁盘满了服务悄悄挂,半夜才发现 | 磁盘 <80%;关键容器 running |
注意类别划分背后的逻辑:先保「能不能访问」,再保「内容对不对」,再保「还能撑多久」。前两类是当下故障,后两类是未来故障——巡检清单要把「已经在坏」和「快要坏」都覆盖到。
三、阈值怎么定:宁缺毋滥,有料才吵
阈值定得松,故障漏报;定得紧,噪音刷屏。我们的三个原则:
- 正常范围留余量:响应时间正常 0.1 秒,阈值定 3 秒——不是定 0.5 秒。留余量是为了只报「真异常」,不报「波动」;
- 静默是默认状态:一轮巡检全绿,什么都不发。告警是稀有事件,出现就有分量;
- 实测值必须带上:告警消息里永远有「实测值 + 期望值」——收到的人不用猜严重程度。
四、真实的清单:8 项,为什么是这 8 项
下面是我们自己在用的真实清单(2026-09-02 实测):
| # | 检查项 | 实测值 | 正常标准 | 它防的是 |
|---|---|---|---|---|
| 1 | 主站 HTTP | 200 | =200 | 整站打不开 |
| 2 | 首页特征内容 | 存在 | 关键文本在 | 被黑/被改 |
| 3 | SSL 证书剩余 | 82 天 | >30 天 | 证书过期访问中断 |
| 4 | 响应时间 | 0.11s | <3s | 慢到用户流失 |
| 5 | 服务器 SSH 端口 | 开放 | 开放 | 远程管理通道断 |
| 6 | 服务器 HTTP 端口 | 开放 | 开放 | 对外服务断 |
| 7 | 服务器 HTTPS 端口 | 开放 | 开放 | 加密访问断 |
| 8 | 业务子站 | 200 | =200 | 子业务不可用 |
为什么没有第 9 项「每张页面都盯」?因为没必要——首页通了、关键服务通了,整站级别的故障已经覆盖。盯住关键路径,而不是盯住一切——这是清单不膨胀的秘诀。
五、噪音是怎么压没的
清单定完,还有一个问题:磁盘检查、容器检查这类要服务器权限的项目怎么办?客户环境里不一定给你权限。
我们的处理:没有权限的项目,降级为「外部可达性检查」,不硬做。服务器磁盘查不了?那就查服务器端口通不通——端口是外部能验证的,磁盘是内部才能看的。能查什么就查什么,查不到的不硬凑,宁可少一项,不报假数据。
六、小结
巡检清单不是技术活,是取舍活:每一项都要回答「不盯它会怎样」,阈值宁缺毋滥,静默是默认。清单定好,告警一年没几条,每一条都值得处理——这比天天刷屏的监控有用一百倍。
延伸:和「AI 应用独立验收」是同一套思维
如果你觉得这套「定清单」的思路眼熟——是的,它和我们做 AI 应用交付时的验收用例设计完全同构:每一项检查都要回答「不验证它会怎样」,用例覆盖正常、边界、刁钻三类场景,噪音和漏检之间取平衡。
判断一个 AI 交付靠不靠谱,靠的就是同一套取舍:用例是长出来的,不是写出来的。感兴趣可以看我们的独立验收方法论:交付靠不靠谱,看它的用例质量和上线前怎么验——一套可复用的验收方法论。
下一篇讲第二件事:外部信息的盯梢——网站不出事只是底线,竞品变了价、上游发了新版,这些「变化」怎么第一时间知道。
常见问题
巡检清单能直接照抄吗?
四类框架(可达性、内容、证书时效、资源水位)可以直接照抄,具体检查项按你自己的资产改——换 URL、换特征词、换阈值。定好的标准是「每一项都要回答不盯它会怎样」。
巡检会误报或者漏报吗?
误报靠阈值余量和静默设计压到最低(正常范围留余量、正常就不发消息);漏报是周期巡检的固有边界(30 分钟内故障下一轮才发现)。没有万无一失的监控,好的清单是告警稀少且每条都值得处理。