为什么值得单独查一遍可用性监控
大部分站点都装了监控,但很多监控只做一件事:每隔几分钟请求一次首页,看到 200 就认为一切正常。这种配置能发现整站挂掉,却很难发现“首页正常、栏目页 500”“图片服务器不可用”“证书过期半天没人管”这类问题。对搜索蜘蛛来说,这些局部故障同样会打断抓取。
一、频率和超时是否匹配站点规模
间隔太长,故障可能持续几十分钟才被发现;间隔太短,又会对服务器造成额外压力,尤其是低配机器和抓取高峰重叠时。可以按重要性分级:首页与核心栏目页 1 到 3 分钟一次,普通内容页 5 到 10 分钟一次。超时阈值不要设得比正常响应还紧张,否则会出现大量“假宕机”。建议按正常首字节时间的 3 到 5 倍来设。
二、别只看状态码,要校验内容特征
返回 200 不代表页面正常。常见的坑包括:
- 页面状态码 200,正文却写着“数据库连接失败”;
- 被 CDN 或 WAF 拦下,返回一张人机验证页;
- 模板改版后,关键区块没有渲染出来。
做法是在监控里加一段关键字校验,例如检查页面中是否出现固定的标题、版本号,或正文长度是否大于某个阈值。关键字要选那种基本不会出现在错误页上的内容。
三、探测点与线路差异
单点探测只代表那一条线路。如果站点用了 CDN 或有多线机房,建议至少配置两个不同地域的探测点。有些异常只在特定区域或特定运营商出现,本地反复测试都是正常的,很容易误判成误报。
四、把证书、DNS、域名有效期一起纳入
这几项属于“定时炸弹”型问题,平时看不出异常,到期当天直接全站不可访问。监控项至少应包含:HTTPS 证书剩余天数,提前 30 天和 14 天两级提醒;域名到期时间;DNS 解析结果是否与预期 IP 一致。解析被误改导致的跳转异常,往往比服务器宕机更难排查。
五、告警要送到有人看的地方
告警发到没人查看的邮箱,等于没有监控。检查几点:告警通道是否包含即时通讯或短信;是否有明确的接收人;夜间与节假日如何处理;同一故障是否会被反复轰炸,有没有收敛和静默规则。
六、恢复通知与事后记录
告警容易做,恢复通知经常被忽略。站长需要知道“什么时候恢复的”,否则会重复排查。另外每次故障建议简单记一行:时间、现象、受影响页面、处理动作。积累几个月后往往会看出规律,比如总是某台机器磁盘写满,或者总是在备份任务运行时全站变慢。
一份可执行的自查清单
- 首页、栏目页、内容页、站内搜索页都有监控覆盖;
- 监控包含内容校验,而不只是状态码;
- 至少两个不同地域的探测点;
- 证书、DNS、域名到期都有独立提醒;
- 告警有明确接收人和值班约定;
- 有恢复通知,并有简单的故障记录习惯。
监控的目标不是“装一个工具”,而是让故障从“用户先发现”变成“自己先发现”。频率、内容校验、告警去向这三件事做到位,多数低级故障就能在影响抓取之前被处理掉。