遇到頁面不收錄,很多人第一反應是去搜尋资源平台看索引狀態,却忽略了手上本来就有一份原始資料:服務器日誌。日誌记錄的是“谁在什么时候抓了哪個 URL、结果如何”,它不能直接告诉你收錄與否,但能說明抓取這一环有没有出問题。
日誌能回答什么,不能回答什么
能回答的是:蜘蛛来過没有、来過几次、抓了哪些 URL、返回什么狀態碼、抓取深度大概到第几层、是否集中在某几個目錄。不能回答的是:頁面有没有進索引、排名如何、搜尋展現如何。
收錄是搜尋引擎内部的判断,日誌里看不到。所以正确的用法是:先用日誌確認抓取是否正常,如果抓取正常却始终不收錄,再把注意力放回内容质量、頁面结构這些地方。
先確認訪問者是不是真的蜘蛛
- User-Agent 可以伪造,只凭 UA 判断容易被采集器誤導。
- 可以對百度、Google 等官方公布的 IP 段做反向解析校驗,確認来源是否真實。
- 把確認過的蜘蛛單獨归類統計,不要和普通爬虫、监控脚本混在一起。
值得重点看的几個字段
- 狀態碼分布:200 的占比是多少,404 與 5xx 有没有集中出現。大量 5xx 可能让蜘蛛主動降低抓取频率。
- 被抓 URL 的分布:是否只集中在首頁和几個栏目,新發布的頁面几乎没被抓過。
- 抓取频次的時間曲线:频次骤降往往和服務器不稳定、頁面质量下滑有關。
- 响應時間與返回大小:長期超时,或返回内容极小,都會影响蜘蛛對站点的判断。
几種常见現象與對應方向
- 蜘蛛從没出現過:先检查 robots.txt 是否全站屏蔽,以及站点有没有任何外部入口。
- 只抓首頁不抓内頁:多數是内鏈结构問题,深层頁面缺少可抓取的路径。
- 抓了内頁但狀態碼異常:優先修掉 404、5xx 和過長的重定向鏈。
- 抓取频繁但新内容迟迟不被抓:可能是更新幅度小,或者入口位置太深。
- 抓取一切正常,索引狀態長期不動:問题多半不在抓取,回到内容與頁面本身。
日誌只能證明“被抓過”,不能證明“被收錄”。把這两件事分開看,排查方向才不會跑偏。
一個可操作的排查顺序
- 導出最近 7 到 30 天的日誌,過滤出官方蜘蛛的訪問记錄。
- 按狀態碼統計,先確認有没有大面积的 4xx、5xx。
- 按 URL 归類,看新頁面有没有被抓,抓取深度到了第几层。
- 對比抓取频次的變化,判断是否出現異常波動。
- 把抓取正常的 URL 單獨列出,逐個核對索引狀態,区分“没抓”和“抓了没收錄”。
日常维護上,保持服務器稳定、减少無意义參數頁被反复抓取、让新頁面在站内連結和站点地图里都有明确入口,通常比反复手動提交 URL 更有用。日誌的價值在于,它把“蜘蛛到底做了什么”變成可核對的資料,而不是靠猜。