收录出问题时,多数人第一反应是打开索引状态报告。但这份报告只给结果:已发现、已抓取、未收录。它不会告诉你搜索引擎到底把抓取预算花在了哪些目录上。想看过程,服务器日志更直接——每一条蜘蛛访问都带着 URL、状态码、时间和 UA。
日志能回答索引报告回答不了的问题
报告会说“已抓取,未编入索引”,但不会说这个 URL 被反复抓了三十次。日志可以。当你把一段时间内的抓取记录按目录聚合,往往会看到非常不均衡的分布:首页、列表页、详情页、参数页、归档页各自被访问的次数,可能差出好几倍。
这种分布本身就是信号。抓取集中的地方,说明入口多、内链强;长期空白的目录,说明搜索引擎既没从 sitemap 也没从内链发现它,或者发现了但判断不值得再来。
动手前先做三件事
- 验证 UA。别看 UA 字符串里有“bot”就当真,这个字段能伪造。条件允许的话做反向 DNS,或对照官方公布的 IP 段。
- 保留完整 URL。只记路径会把带参数的页面混在一起,后面分不开。
- 取够时间窗。至少覆盖四周,小站可以拉长到两三个月,避免把偶发波动当成趋势。
按目录聚合,看几个指标
- 每个目录的抓取次数和占比;
- 状态码构成:200、304、301、404、5xx 各占多少;
- 平均响应时间,以及最慢的那一批 URL;
- 被抓 URL 的去重数量,而不是总请求数。
最后一项容易被忽略。总请求数高,可能只是同一批页面被反复抓,并不代表覆盖面广。用去重 URL 数除以目录里的实际 URL 数,才更接近“这个目录被扫了多少”。
三种常见的分布形态
集中在少数新页面
通常是正常现象,新内容有入口、更新频繁。要确认的是老页面有没有被彻底遗忘。
集中在老页面反复抓取
常见于列表页、筛选页、分页参数。这些 URL 状态码正常,但内容变化极小,蜘蛛一次次来,产出却很低。处理方向是收敛入口:能合并的合并,该规范化的规范化,该屏蔽的屏蔽。
集中在返回错误的页面
大量 5xx 或超时会明显拖慢整站的抓取节奏。先修后端和缓存,再谈收录。
和 sitemap、内链对照着看
把 sitemap 里提交的目录和日志里真正被抓的目录并排放到一起,差异就是线索:提交了但没人抓,多半是站点整体抓取优先级的问题;没提交却抓得很勤,说明内链在替 sitemap 干活。两种都不算坏事,但你需要知道哪条路径在起作用,否则调整时会误判因果。
日志说明的是抓取行为,不是收录结果。一个 URL 被抓很多次仍然没进索引,问题多半在内容质量、重复程度或规范标签上,而不是抓取次数不够。
可以固定下来的月度自查
- 导出日志并按 UA 过滤,按目录聚合;
- 标出零抓取的目录,逐个检查是否有内链入口;
- 标出高频抓取但内容几乎不变的 URL,评估是否收敛;
- 统计 4xx、5xx 占比,超过阈值就排优先级修;
- 把结论和索引状态报告对照,分成“抓了没收”和“没抓也没收”两类,分别处理。
做上几个月,你会对自家站点的抓取节奏有个基本体感。这比每次都从索引报告倒推原因要省事得多。