网站收录

服务器日志里的抓取分布:哪些目录在被反复抓,哪些一直没人来

索引报告只告诉你结果,日志能告诉你过程。本文讲怎么从服务器日志里按目录统计搜索引擎的抓取次数、状态码和响应时间,识别被反复抓取却没什么产出的页面,以及长期没有蜘蛛访问的栏目,再据此调整内链、sitemap 和参数处理顺序。

网站收录

服务器日志里的抓取分布:哪些目录在被反复抓,哪些一直没人来

收录出问题时,多数人第一反应是打开索引状态报告。但这份报告只给结果:已发现、已抓取、未收录。它不会告诉你搜索引擎到底把抓取预算花在了哪些目录上。想看过程,服务器日志更直接——每一条蜘蛛访问都带着 URL、状态码、时间和 UA。

日志能回答索引报告回答不了的问题

报告会说“已抓取,未编入索引”,但不会说这个 URL 被反复抓了三十次。日志可以。当你把一段时间内的抓取记录按目录聚合,往往会看到非常不均衡的分布:首页、列表页、详情页、参数页、归档页各自被访问的次数,可能差出好几倍。

这种分布本身就是信号。抓取集中的地方,说明入口多、内链强;长期空白的目录,说明搜索引擎既没从 sitemap 也没从内链发现它,或者发现了但判断不值得再来。

动手前先做三件事

  1. 验证 UA。别看 UA 字符串里有“bot”就当真,这个字段能伪造。条件允许的话做反向 DNS,或对照官方公布的 IP 段。
  2. 保留完整 URL。只记路径会把带参数的页面混在一起,后面分不开。
  3. 取够时间窗。至少覆盖四周,小站可以拉长到两三个月,避免把偶发波动当成趋势。

按目录聚合,看几个指标

  • 每个目录的抓取次数和占比;
  • 状态码构成:200、304、301、404、5xx 各占多少;
  • 平均响应时间,以及最慢的那一批 URL;
  • 被抓 URL 的去重数量,而不是总请求数。

最后一项容易被忽略。总请求数高,可能只是同一批页面被反复抓,并不代表覆盖面广。用去重 URL 数除以目录里的实际 URL 数,才更接近“这个目录被扫了多少”。

三种常见的分布形态

集中在少数新页面

通常是正常现象,新内容有入口、更新频繁。要确认的是老页面有没有被彻底遗忘。

集中在老页面反复抓取

常见于列表页、筛选页、分页参数。这些 URL 状态码正常,但内容变化极小,蜘蛛一次次来,产出却很低。处理方向是收敛入口:能合并的合并,该规范化的规范化,该屏蔽的屏蔽。

集中在返回错误的页面

大量 5xx 或超时会明显拖慢整站的抓取节奏。先修后端和缓存,再谈收录。

和 sitemap、内链对照着看

把 sitemap 里提交的目录和日志里真正被抓的目录并排放到一起,差异就是线索:提交了但没人抓,多半是站点整体抓取优先级的问题;没提交却抓得很勤,说明内链在替 sitemap 干活。两种都不算坏事,但你需要知道哪条路径在起作用,否则调整时会误判因果。

日志说明的是抓取行为,不是收录结果。一个 URL 被抓很多次仍然没进索引,问题多半在内容质量、重复程度或规范标签上,而不是抓取次数不够。

可以固定下来的月度自查

  1. 导出日志并按 UA 过滤,按目录聚合;
  2. 标出零抓取的目录,逐个检查是否有内链入口;
  3. 标出高频抓取但内容几乎不变的 URL,评估是否收敛;
  4. 统计 4xx、5xx 占比,超过阈值就排优先级修;
  5. 把结论和索引状态报告对照,分成“抓了没收”和“没抓也没收”两类,分别处理。

做上几个月,你会对自家站点的抓取节奏有个基本体感。这比每次都从索引报告倒推原因要省事得多。