排查收录问题时,大家习惯先看站长平台的索引数据,但索引是结果,抓取才是过程。当索引数字长期不动、新页面迟迟没有反应时,服务器日志往往比后台报表更早给出线索。这篇文章讲的是怎么读日志,以及从日志里能得到哪些和收录相关的判断。
为什么要先看日志
搜索蜘蛛来过没有、来过多少次、停在哪个状态码、有没有继续往里爬,这些都会落在访问日志里。后台的抓取统计通常有延迟,也做了聚合,而日志是逐条记录,能看到具体 URL 和先后顺序。两者结合看,才能分清是“没被抓”还是“抓了没收”。
第一步:确认身份,别把普通流量当蜘蛛
UA 可以伪造,所以不能只看 User-Agent 字符串。
- 用反向 DNS 或官方公布的 IP 段做校验,确认确实是目标搜索引擎的蜘蛛。
- 区分不同产品线,比如移动端蜘蛛、图片蜘蛛、桌面蜘蛛,它们的抓取行为并不完全一样。
- 把第三方工具、监控探针、合作方抓取排除掉,否则抓取量会被高估。
如果日志里出现大量自称蜘蛛但 IP 对不上的请求,先按普通爬虫处理,不要据此判断收录。
第二步:看频次和分布,而不是总量
只看一天的抓取总数意义有限,更有用的是分布:
- 目录维度:抓取是集中在首页和几个热门栏目,还是能覆盖到深层目录?长期只抓少数几个目录,说明内链入口或层级存在问题。
- 时间维度:抓取是均匀分布,还是集中在某几天?突然的峰值,可能对应你做了某次改版或大量提交。
- 新旧比例:新 URL 的抓取占比有多少?如果全是老页面反复抓,新内容就排不上队。
第三步:状态码能说明很多事
按状态码分组统计一天的日志,通常就能看出问题:
- 大量 200 但集中在参数页、筛选页,说明抓取被低价值 URL 消耗掉了。
- 比例偏高的 301,可能是站内跳转链太长,或者 URL 规范还没收敛。
- 404 持续出现且来源是内链,说明站内还有失效链接没清理。
- 5xx 或 403 说明服务器扛不住,或者做了误拦截,这类问题会直接影响抓取频次。
- 被 robots.txt 挡下的请求也会被记录,可以借此确认屏蔽规则是否符合预期。
抓取频次下降不一定是被降权,也可能只是服务器响应变慢,或者站内多了大量低质量 URL,让蜘蛛把额度花在了别处。
第四步:看抓取落点,是进了还是停在门口
如果蜘蛛的一次会话里只抓了列表页就离开,说明它没找到值得继续跟进的目标;如果抓了大量详情页却很少回头,可能是内容重复度偏高,蜘蛛判断不值得重复抓取。可以挑几个已知的新页面,在日志里搜一下:有没有被访问过、访问了几次、返回什么状态。这是最直接的验证方式。
第五步:把日志和索引数据放在一起看
常见的四种组合:
- 抓了、也进了索引:正常。
- 抓了、没进索引:多半是页面质量、重复度或内容太薄。
- 没抓、却在索引里:属于历史遗留或外链带进去的 URL,需要判断是否值得保留。
- 没抓、也没进索引:问题出在发现环节,回到内链、sitemap 和入口页检查。
操作上的几点提醒
- 日志量大的站点先做采样,不必全量分析,按天或按目录抽一部分就够。
- 分析周期至少拉长到一周以上,单日数据波动大,容易误判。
- 调整内链或屏蔽规则后,保留调整前后的日志做对照,否则很难判断是否真的有变化。
- 把结论落到具体 URL 组上,不要只停在“抓取量下降了”这种描述。
日志分析不能保证收录,也不会有立竿见影的效果,但它能把问题定位到具体环节:是没被发现、没被抓好,还是抓了但没有通过质量判断。方向对了,后面的动作才有意义。