站点运营

站点运营:可用性监控与宕机告警自查,别让站点停摆几小时才被发现

很多站点只盯着首页状态码,看似有监控,实则漏掉栏目 500、证书过期、CDN 拦截、DNS 被误改等问题。本文从监控频率、内容校验、多点探测、证书与域名提醒、告警通道、恢复通知六个角度,给出一份可以直接照着逐项排查的可用性监控自查清单。

站点运营

站点运营:可用性监控与宕机告警自查,别让站点停摆几小时才被发现

为什么值得单独查一遍可用性监控

大部分站点都装了监控,但很多监控只做一件事:每隔几分钟请求一次首页,看到 200 就认为一切正常。这种配置能发现整站挂掉,却很难发现“首页正常、栏目页 500”“图片服务器不可用”“证书过期半天没人管”这类问题。对搜索蜘蛛来说,这些局部故障同样会打断抓取。

一、频率和超时是否匹配站点规模

间隔太长,故障可能持续几十分钟才被发现;间隔太短,又会对服务器造成额外压力,尤其是低配机器和抓取高峰重叠时。可以按重要性分级:首页与核心栏目页 1 到 3 分钟一次,普通内容页 5 到 10 分钟一次。超时阈值不要设得比正常响应还紧张,否则会出现大量“假宕机”。建议按正常首字节时间的 3 到 5 倍来设。

二、别只看状态码,要校验内容特征

返回 200 不代表页面正常。常见的坑包括:

  • 页面状态码 200,正文却写着“数据库连接失败”;
  • 被 CDN 或 WAF 拦下,返回一张人机验证页;
  • 模板改版后,关键区块没有渲染出来。

做法是在监控里加一段关键字校验,例如检查页面中是否出现固定的标题、版本号,或正文长度是否大于某个阈值。关键字要选那种基本不会出现在错误页上的内容。

三、探测点与线路差异

单点探测只代表那一条线路。如果站点用了 CDN 或有多线机房,建议至少配置两个不同地域的探测点。有些异常只在特定区域或特定运营商出现,本地反复测试都是正常的,很容易误判成误报。

四、把证书、DNS、域名有效期一起纳入

这几项属于“定时炸弹”型问题,平时看不出异常,到期当天直接全站不可访问。监控项至少应包含:HTTPS 证书剩余天数,提前 30 天和 14 天两级提醒;域名到期时间;DNS 解析结果是否与预期 IP 一致。解析被误改导致的跳转异常,往往比服务器宕机更难排查。

五、告警要送到有人看的地方

告警发到没人查看的邮箱,等于没有监控。检查几点:告警通道是否包含即时通讯或短信;是否有明确的接收人;夜间与节假日如何处理;同一故障是否会被反复轰炸,有没有收敛和静默规则。

六、恢复通知与事后记录

告警容易做,恢复通知经常被忽略。站长需要知道“什么时候恢复的”,否则会重复排查。另外每次故障建议简单记一行:时间、现象、受影响页面、处理动作。积累几个月后往往会看出规律,比如总是某台机器磁盘写满,或者总是在备份任务运行时全站变慢。

一份可执行的自查清单

  1. 首页、栏目页、内容页、站内搜索页都有监控覆盖;
  2. 监控包含内容校验,而不只是状态码;
  3. 至少两个不同地域的探测点;
  4. 证书、DNS、域名到期都有独立提醒;
  5. 告警有明确接收人和值班约定;
  6. 有恢复通知,并有简单的故障记录习惯。
监控的目标不是“装一个工具”,而是让故障从“用户先发现”变成“自己先发现”。频率、内容校验、告警去向这三件事做到位,多数低级故障就能在影响抓取之前被处理掉。