监控這件事,很多站点都是出事之後才想起来加。用戶反馈打不開、蜘蛛抓取量突然掉、排名往下走,才回头翻日誌。與其被動补,不如按一份清單把监控和告警過一遍,重点是覆盖范围、判断标准和處理流程,而不是堆一堆看板。
一、先確認监控覆盖了哪些地址
- 首頁、栏目頁、詳情頁模板各取一個代表 URL;
- 關键接口,比如登入、搜尋、表單提交;
- robots.txt 與站点地图地址;
- 移動端或獨立模板的入口;
- 多域名、子域名、多地区入口。
只监控首頁是最常见的盲区。首頁通常走了缓存,内頁要走資料库或接口,两者出故障的時間点往往不一样,只盯一個地址容易漏。
二、判断标准:狀態碼之外還要看什么
- HTTP 狀態碼是否符合预期,是否出現 5xx 或意外跳轉;
- 响應時間是否超出平时基线;
- 返回頁面里是否包含關键特征,比如标题關鍵詞、核心区块;
- HTTPS 證书剩余有效期;
- DNS 解析是否正常。
只看 200 並不够。有的故障頁面照样返回 200,但内容是错誤提示或空白模板,属于典型的软 404 场景。加一條内容特征校驗,能早一步發現問题。
三、采样频率與告警阈值
频率不必一味求快。核心接口可以一分钟一次,内容頁五到十分钟一次通常就够用。阈值建议设成连續 N 次失敗再通知,比如连續三次異常才發告警,避免網絡抖動带来的一串誤报。
告警的價值在于每條都值得看一眼。如果一天收到几百條,最後没有人會打開。
四、告警發给谁,怎么分級
- P1:首頁或核心接口不可用,直接电话或即时通讯找人;
- P2:部分栏目異常、整体响應變慢,發到值班群;
- P3:證书临近到期、磁盘接近阈值,進待办清單按周處理。
要有人负责,也要有明确的兜底人。值班表長期不更新,告警等于没發。
五、把蜘蛛来訪和抓取異常纳入观察
监控不只是给用戶看的。可以顺带观察服務器日誌里的几項趋势:蜘蛛訪問量、5xx 返回比例、抓取耗时。如果某天蜘蛛訪問量突然归零,或者 5xx 比例明顯上升,通常說明站点某處已经出問题了,比排名變化出現得更早。
需要提醒的是,這些只是观察指标,用来判断站点是否健康,不要理解成抓取量高就一定有好的表現。
六、容易忽略的监控盲区
- 只监控 www,忘了裸域名和二級域名;
- 只监控 PC 版本,移動端 UA 走的是另一套模板;
- 栏目改版後舊路径已经 404,监控項却還留在列表里;
- 监控机在 IP 白名單内,绕過了 CDN 和防火墙,测不到真實鏈路;
- 告警只發到信箱,节假日没人看。
七、定期做一次告警鏈路演练
监控本身也會失效:探针挂了、密钥過期、通知渠道被折叠。建议隔一段時間手動制造一次小故障,比如临时改一個測試路径,確認告警能按时送達、能顺利找到人。
整套自查不必一次做完。先把首頁、一個栏目頁、一個接口加進去,把 P1 告警跑通,再逐步补覆盖面與分級,比一上来就上复杂方案更容易落地。