很多人判断收录,习惯直接看索引数量或者 site 查询。真到排查问题时,索引报告给的是结果,日志给的才是过程。蜘蛛来过没有、抓了哪些 URL、服务器返回了什么,这些只能从日志里看到。把日志和索引状态放在一起看,才能判断问题卡在发现、抓取还是收录。
抓取和收录不是同一件事
日志里出现某个 URL,只能说明蜘蛛访问过。它可能只是抓走内容,后续因为质量、重复、规范化等原因没有放入索引;也可能当天抓了,过几天才进入索引。反过来,日志里很少出现的 URL 也未必没收录,它可能早已被索引,只是重新抓取的频率低。所以日志适合回答“蜘蛛看到了什么”,不适合单独用来回答“页面有没有被收录”。
先盯住日志里的三个字段
状态码分布
把日志按状态码分组,重点看 200、301、302、404、410、5xx 的比例。大量 301 说明站内还有旧链接指向老地址;大量 404 说明蜘蛛在反复访问已经不存在的页面;5xx 或超时记录集中出现,说明抓取被服务器状态挡住了。这些都会影响蜘蛛继续发现新 URL 的意愿。
被抓的 URL 类型
再看蜘蛛具体抓了哪些页面。如果翻来覆去都是列表页、筛选页、参数页,而真正想被收录的内容页很少出现,那说明站内入口和链接结构把抓取引到了低价值页面上。这时要回到内链和 URL 设计上调整,而不是只盯着内容页本身。
抓取频次的变化
不用追求每天的抓取量都涨。更有参考价值的是趋势:新内容上线后,蜘蛛是否在合理时间内来过;改版或调整链接后,被抓的 URL 类型有没有跟着变化。单日波动通常说明不了什么,连续几周的方向才值得跟进。
几种常见的误读
- 日志里全是 200,就以为收录没问题。200 只代表抓取成功,索引是否收录是另一回事。
- 看到蜘蛛来了就等着收录。抓取只是前置动作,页面质量、重复程度、规范化信号都会影响后续处理。
- 日志里没看到某个 URL,就断定没被发现。蜘蛛可能通过其他入口访问,也可能只是在别的时间段来。
- 只看总抓取量,不看抓了什么。量涨了但抓的都是垃圾 URL,对收录没有帮助。
一个可行的对照顺序
- 先从日志里筛出搜索蜘蛛的记录,按状态码分组。
- 看被抓 URL 的分布,确认重点内容页是否在抓取范围内。
- 把重点 URL 拿去查索引状态,和日志记录对照。
- 如果抓取正常但未收录,回到页面质量、重复内容和规范化设置上排查。
- 如果连抓取都很少,优先补站内入口、清理失效链接,再谈提交和收录。
日志是抓取侧的记录,索引状态是收录侧的结果。两者对不上时,先确认差异出在哪一步,再决定改什么。