先分清“抓取少了”和“抓取没變”
看到統計里的蜘蛛數量下滑,很多人的第一反應是池子出問题了,于是马上換域名、換 IP、加大投放。但抓取量的波動来源很多:日誌統計口径變了、服務器时钟不准、采集脚本只統計了部分 UA、CDN 把一部分請求挡在了回源之前。這些没排除之前就動手,等于把問题叠了一层。先定位,再調整。
第一层:日誌本身是否可信
- 統計范围:是否只統計了部分入口域名,是否有节点没接入日誌。
- UA 過滤:真蜘蛛與伪蜘蛛混在一起統計时,數量會被放大或缩小,建议把 UA、IP 反查、請求路径三個條件一起看。
- 時間對照:對比昨天、上周同一天的同一时段,而不是對比印象中的高峰。
- 狀態碼分布:200 占比、3xx、4xx、5xx 各是多少,往往比總量更能說明問题。
第二层:入口頁還能不能正常返回
抓取量掉下来,常见原因是入口頁本身返回異常。可以按這個顺序看:
- 直接請求入口頁,確認 HTTP 狀態碼、响應時間、返回内容是否為预期頁面;
- 检查 DNS 解析是否被改動、TTL 是否過長導致切換不及时;
- 检查證书是否過期,HTTP 與 HTTPS 是否都能正常訪問;
- 检查 WAF、防火墙、CDN 規則是否誤拦了蜘蛛 IP 段;
- 检查是否有大批入口頁同时返回 404 或 503。
如果入口頁整体可用,但某個目錄抓取几乎為零,重点看该目錄下的頁面是否被批量改動、刪除或重定向。
第三层:鏈路是否還通
入口頁正常,不代表蜘蛛能走到目标頁。顺着鏈路往下看一遍:跳轉是否還生效、目标頁是否可訪問、是否被 robots 或 meta 挡住、是否触發了登入或驗證碼。這一段经常被忽略,因為入口頁的监控指标看上去一切正常。
抓取量只是過程指标。抓取恢复正常不代表收錄會恢复,收錄還取决于目标頁本身是否值得收錄。
建议的排查顺序
按“從外到内、從便宜到贵”的顺序處理:先核對統計口径,再测入口頁可用性,接着看跳轉鏈路,最後才考虑资源层的調整,比如換 IP、換域名或調整投放量。每次只改一個變量,改完观察一個完整周期再下判断,否則很难知道是哪一步起了作用。
把基线數记下来
與其记一堆经驗規則,不如给池子记几個基线數:日均抓取請求數、200 占比、入口頁平均响應時間、異常狀態碼占比。有了基线,波動是噪声還是故障一眼就能分辨,更換资源或調整規模之後也方便做前後對比。