常见问题

搜索蜘蛛反复抓入口页却不重抓目标页:抓取、缓存、收录要分开看

入口页抓取活跃但目标页迟迟没更新,是抓取、缓存、收录被混为一谈的典型表现。文章把三个环节拆开,列出目标页没有动静的常见原因,给出按日志核对的排查顺序,以及入口页这一侧可以做的调整。

常见问题

搜索蜘蛛反复抓入口页却不重抓目标页:抓取、缓存、收录要分开看

做蜘蛛池或入口页运营时,常会遇到一类现象:日志里搜索蜘蛛对入口页的抓取很勤,但目标页的缓存快照几周没变,站内搜索也看不到更新。这种时候容易误判为“蜘蛛池没用”或“目标页被降权”,实际上多数情况是三个环节被混在了一起:抓取、缓存、收录。把它们拆开看,问题通常清楚很多。

抓取、缓存、收录是三个不同环节

  • 抓取:搜索蜘蛛向服务器发出请求并拿到响应。服务器日志里能看到这一层,站长平台里的已抓取数据也属于这一层。
  • 缓存:搜索引擎为页面生成的一份可展示副本,更新节奏通常比抓取慢,而且不一定每次抓取都刷新。
  • 收录:URL 进入索引并可被检索。它依赖抓取结果和内容判断,但不由抓取次数直接决定。

入口页的作用主要集中在第一个环节:帮助发现 URL,并促成一次抓取请求。后面两件事,入口页能施加的影响相对有限。

入口页一直被抓、目标页却没动静的常见原因

  • 目标页缺少变化信号:Last-Modified、ETag 没有更新,蜘蛛拿到 304,自然不会重新计算内容。
  • 抓取额度被入口页占掉:入口页数量大、互相链接密,蜘蛛在同一个站点反复爬,留给目标页的请求就少了。
  • 目标页本身有拦截:robots、meta robots、X-Robots-Tag、登录墙、验证码,都会让抓取或入库停在半路。
  • 响应质量不佳:慢、超时、偶发 5xx,或者正文与入口页高度相似,都会降低重抓意愿。
  • 发现路径单一:只靠入口页里的链接,缺少 Sitemap、站内内链、其他外链的交叉验证,蜘蛛对这条 URL 的重视程度有限。

按这个顺序排查更省时间

  1. 在服务器日志里确认蜘蛛是否真的请求过目标 URL,而不是只请求了入口页。检索时匹配目标路径,不要只盯着入口页的访问记录。
  2. 检查目标 URL 返回的状态码和响应头,重点看 200、301、304、403、429、5xx,以及 Last-Modified 是否合理。
  3. 检查目标页的 robots 相关设置,以及登录、验证码、地域限制等因素。
  4. 查看站点抓取统计里入口页与目标页的抓取占比,判断是不是额度分配的问题。
  5. 对比入口页与目标页的正文,确认是否存在明显重复或模板化。
  6. 用 Sitemap 或站内搜索确认目标页是否已进入索引,而不是只拿缓存快照当唯一标准。

入口页这一侧可以做的调整

  • 控制单页链接数量,避免把链接堆在 HTML 靠后位置,减少一次抓取读不完的情况。
  • 入口页内容保持差异,别整站套同一个模板,降低被判定为低价值页面的概率。
  • 链接尽量指向最终页,不要层层跳转,减少蜘蛛在中间页消耗的请求。
  • 为重要目标页补充 Sitemap,修改时间保持真实,不要频繁伪造更新。
  • 定期维护入口页:替换失效链接、更新指向已变更的页面,别让入口页自己变成一堆 404 或 301。

几个容易走偏的判断

日志里蜘蛛来得多,不等于目标页会被收录;缓存快照没更新,也不等于页面没有被抓取。这两件事都需要分别验证。
  • 把抓取频次上升当成收录的前置保证。
  • 只盯入口页的抓取量,不看目标页的实际请求记录。
  • 入口页数量猛增,目标页却很少,最后大部分请求都消耗在入口页上。
  • 用快照时间当收录依据,掩盖了页面其实已在索引、只是快照未刷新的事实。

把抓取、缓存、收录分开记录,再按上面的顺序逐项核对,大多数“入口页在抓、目标页没反应”的问题都能定位到具体环节。入口页负责被发现和发起请求,能否走到后面,取决于目标页自身的可抓取性和内容判断。