监控这件事,很多站点都是出事之后才想起来加。用户反馈打不开、蜘蛛抓取量突然掉、排名往下走,才回头翻日志。与其被动补,不如按一份清单把监控和告警过一遍,重点是覆盖范围、判断标准和处理流程,而不是堆一堆看板。
一、先确认监控覆盖了哪些地址
- 首页、栏目页、详情页模板各取一个代表 URL;
- 关键接口,比如登录、搜索、表单提交;
- robots.txt 与站点地图地址;
- 移动端或独立模板的入口;
- 多域名、子域名、多地区入口。
只监控首页是最常见的盲区。首页通常走了缓存,内页要走数据库或接口,两者出故障的时间点往往不一样,只盯一个地址容易漏。
二、判断标准:状态码之外还要看什么
- HTTP 状态码是否符合预期,是否出现 5xx 或意外跳转;
- 响应时间是否超出平时基线;
- 返回页面里是否包含关键特征,比如标题关键词、核心区块;
- HTTPS 证书剩余有效期;
- DNS 解析是否正常。
只看 200 并不够。有的故障页面照样返回 200,但内容是错误提示或空白模板,属于典型的软 404 场景。加一条内容特征校验,能早一步发现问题。
三、采样频率与告警阈值
频率不必一味求快。核心接口可以一分钟一次,内容页五到十分钟一次通常就够用。阈值建议设成连续 N 次失败再通知,比如连续三次异常才发告警,避免网络抖动带来的一串误报。
告警的价值在于每条都值得看一眼。如果一天收到几百条,最后没有人会打开。
四、告警发给谁,怎么分级
- P1:首页或核心接口不可用,直接电话或即时通讯找人;
- P2:部分栏目异常、整体响应变慢,发到值班群;
- P3:证书临近到期、磁盘接近阈值,进待办清单按周处理。
要有人负责,也要有明确的兜底人。值班表长期不更新,告警等于没发。
五、把蜘蛛来访和抓取异常纳入观察
监控不只是给用户看的。可以顺带观察服务器日志里的几项趋势:蜘蛛访问量、5xx 返回比例、抓取耗时。如果某天蜘蛛访问量突然归零,或者 5xx 比例明显上升,通常说明站点某处已经出问题了,比排名变化出现得更早。
需要提醒的是,这些只是观察指标,用来判断站点是否健康,不要理解成抓取量高就一定有好的表现。
六、容易忽略的监控盲区
- 只监控 www,忘了裸域名和二级域名;
- 只监控 PC 版本,移动端 UA 走的是另一套模板;
- 栏目改版后旧路径已经 404,监控项却还留在列表里;
- 监控机在 IP 白名单内,绕过了 CDN 和防火墙,测不到真实链路;
- 告警只发到邮箱,节假日没人看。
七、定期做一次告警链路演练
监控本身也会失效:探针挂了、密钥过期、通知渠道被折叠。建议隔一段时间手动制造一次小故障,比如临时改一个测试路径,确认告警能按时送达、能顺利找到人。
整套自查不必一次做完。先把首页、一个栏目页、一个接口加进去,把 P1 告警跑通,再逐步补覆盖面与分级,比一上来就上复杂方案更容易落地。