URL 發現問题通常不是“有没有被收錄”這么單一,而是持續發生的狀態:連結有没有被看到、看到之後有没有進入抓取队列、抓取是否成功。這些环节分散在搜尋平台後台、服務器日誌和站点结构里,只看一個數字容易誤判。把几項指标固定下来,按周或按双周观察趋势,比临时排查更省力。
先分清“已發現”和“已抓取”
發現和抓取是两個阶段。地址被發現只代表進入了候選队列,抓取還要等調度。後台里“已發現但未抓取”的數量上升,可能意味着站点新增地址太快,也可能意味着服務器响應拖慢了队列消化;而“已抓取”數量稳定但收錄變化不大,則要回头看内容质量與重复度,而不是繼續加連結。
把這两個數字分開记錄,能避免把調度問题当成内容問题處理。
值得放進周报的几组指标
- Sitemap 抓取频次:索引文件和分片文件被請求的次數、返回狀態碼。如果频次骤降,先確認文件本身能正常訪問。
- 新增 URL 數量:本周新增的可訪問地址,與上周對比,增長是否與运营動作匹配。
- 抓取請求總量與狀態碼分布:2xx、3xx、4xx、5xx 各占多少。5xx 比例升高时,抓取队列會被反复占用。
- 平均响應時間:按目錄或模板分组看,比全站平均值更有用。
- 抓取深度分布:被請求的地址里,距离首頁三跳以内的占比。
- 失效地址數量:404、软 404、410 的增减,反映清理是否及时。
這些指标不需要精确到個位數,重点是趋势。建立了三四轮的基线之後,偏离基线往往比绝對數值更有提示意义。
用服務器日誌做交叉驗證
後台資料有延迟和抽样,服務器日誌更接近原始记錄。看日誌时至少保留時間、請求路径、狀態碼、响應時間、User-Agent 和来源 IP 几個字段,便于按 UA 過滤搜尋蜘蛛,再和後台數字對照。
有两個容易踩的坑:一是站点用了 CDN 或反向代理,日誌里的 IP 不是真實訪客,UA 也可能被改寫或缓存;二是把真實用戶和其他爬虫混進統計。先確認日誌采集鏈路,再谈分析。
指标異常时的排查顺序
- 確認 robots.txt 没有誤挡新增目錄,同时检查文件是否可正常讀取。
- 检查 DNS 解析、HTTPS 證书和 CDN 回源,排除连接层問题。
- 查看 5xx 與超时的集中时段,是否與發布、压测或流量高峰重合。
- 核對内鏈结构是否變化,比如導航改版後深层頁面是否失去入口。
- 確認 Sitemap 是否仍被引用,分片文件有没有遗漏或重复。
多數“發現變慢”的問题落在這几步里,很少需要一上来就大改结构。
巡检节奏與记錄方式
建议固定一個节奏,例如每周记錄一次抓取請求總量、狀態碼分布和新增地址數,每月核對一次抓取深度與失效地址。记錄时标注当周的上线動作,後續回看才找得到原因。
指标是用来發現異常的,不是用来追求绝對增長的。抓取量短期波動很正常,连續两三周偏离基线才值得深入排查。
URL 發現和抓取是長期過程,指标的價值在于把“感觉變慢了”變成可以复核的记錄。把观察、對比、排查串成固定動作,站点运营會稳定很多。