收錄數是结果,日誌是過程。只看索引覆盖报告,很难判断一個頁面是没被發現、被抓了但没被采用,還是抓取本身失敗了。把服務器日誌拉出来,和收錄資料放在一起看,很多模糊的問题會變得具体。
第一步:先把日誌里的請求分清楚
日誌里混着搜尋引擎爬虫、第三方工具爬虫、监控探针和真實用戶。分類之前先按 UA 粗筛,再用 IP 反查做校驗,因為 UA 是可以伪造的。
- 搜尋引擎爬虫:Googlebot、Bingbot、Baiduspider 等,是分析重点。
- 其他爬虫:SEO 工具、采集器、监控脚本,會抬高抓取次數,容易造成誤判。
- 真實用戶:用于對照,判断某個 URL 是否還有自然流量入口。
值得盯的几個信号
抓取次數落在哪些 URL 上
把抓取次數按目錄或模板聚合。健康的狀態是首頁、栏目頁、詳情頁都有分布;如果绝大多數請求都集中在首頁和少數几個列表頁,說明爬虫進不去深层,URL 發現或内鏈结构可能有問题。
狀態碼分布
按天統計 200、301、302、404、5xx 的比例。5xx 持續出現會直接影响抓取意愿;大量 301 且跳轉鏈路很長,會浪費抓取配額;404 則要看是新产生的還是歷史遗留。
响應時間
把爬虫請求的平均响應時間和 P95 分開看。平均值正常不代表没問题,少數慢頁面可能正好是需要被收錄的重点頁面。
抓取深度與入口
挑几個没收錄的 URL,反查它們最近有没有被抓過。如果三周内一次都没有出現,問题更可能出在發現环节;如果抓了多次仍未收錄,問题更可能在頁面本身。
哪些日誌痕迹可以先放一放
- robots.txt 主動拒绝的抓取:属于按预期工作,不用当成異常。
- 搜尋引擎抓取校驗文件、favicon、图片等资源:正常行為。
- 零星的 404:多来自外站舊連結,量小且稳定时可以留着观察。
- 第三方工具爬虫的高频請求:和收錄無關,但可能影响服務器负载。
把日誌和收錄报告對照着看
两组資料交叉,通常會落在几種情况里:
- 没抓也没收錄:先查 URL 是否可被發現——内鏈、sitemap、robots.txt 是否放行。
- 抓了没收錄:先看頁面质量、是否與站内已有頁面高度重复、canonical 是否指错。
- 抓了也收錄了但没展示:這已经不属于收錄問题,去看關鍵詞匹配和頁面意图。
- 抓取频率突然下降:優先排查服務器稳定性和错誤率,再考虑内容更新节奏。
建议的巡检顺序
- 按周聚合爬虫請求,確認總量是否有明顯波動。
- 看狀態碼比例,5xx 和異常 404 排在最前。
- 看抓取是否覆盖到目标目錄,而不只是头部几個頁面。
- 挑若干個未收錄 URL,逐一確認最近一次抓取時間。
- 把结论落到具体動作:改内鏈、修错誤、合並重复内容,或者只是繼續观察。
日誌能告诉你爬虫来過没有、来過几次、拿到的是不是正常頁面,但没法直接告诉你為什么没收錄。它是排查的起点,不是结论。