网站收录

抓取额度被低价值地址消耗:先用日志分清主次再收口

蜘蛛来得很勤,收录却没起色,很多时候是抓取被低价值地址消耗掉了。本文按日志归类、状态码修复、参数处理、生成源限制的顺序,说明怎么分清必要的抓取和可以避免的抓取,并给出改动之后值得观察的几个指标。

网站收录

抓取额度被低价值地址消耗:先用日志分清主次再收口

很多站点在提收录时,第一反应是“蜘蛛来得不够多”。但打开服务器日志之后,常见的情况正好相反:蜘蛛来得很勤,只是把大部分时间花在了没有收录价值的地址上,真正需要收录的新页面反而分不到几次抓取。

这篇文章讨论的不是怎么让蜘蛛变多,而是当抓取次数被低价值地址吃掉时,怎么用日志分清主次,再按代价从小到大逐步收口。

先分清:抓取是被消耗,还是被浪费

“消耗”和“浪费”的差别在于这些地址本来有没有价值。分页、筛选、详情页都需要抓取,这是正常的消耗;而带了一长串跟踪参数的副本、早就下线的旧地址、几个 URL 指向同一篇内容,这类抓取很难带来新的收录,更接近浪费。

判断方法不复杂:把某段时间的抓取日志按地址模式归类,看每一类各占多大比例。如果某几类既没有站内入口、也没有外链的地址占了三成以上,就值得处理。

日志里最值得看的几类地址

  • 带参数的副本:跟踪参数、排序参数、会话 ID,同一篇内容被拆成几十个地址。
  • 重定向链和失效地址:A 跳到 B、B 再跳到 C;或者早已删除但仍被反复请求的 404。
  • 重复的列表页:列表按不同排序、不同视图各生成一套 URL,内容几乎一样。
  • 内部搜索与筛选结果页:数量可以无限增长,且大多没有独立价值。
  • 孤岛页面:站内没有任何链接指向,只在 sitemap 或历史记录里存在。

先看比例,再看绝对数量。某个类别的抓取次数是 200 还是 2000,本身说明不了问题;它在总抓取里占多少、这些地址有多少最终被收录,才是判断依据。

处理顺序:从影响最小的一步开始

  1. 修状态码。已经删除的内容不要继续返回 200 或空模板,该 404 就 404,该 410 就 410。把 200 的空壳页当作正常内容,是浪费抓取最常见的原因。
  2. 缩短跳转链。多级 301 不但慢,还会让蜘蛛对目标地址的判断变模糊,统一成一跳到位。
  3. 处理参数副本。能在服务端忽略的参数就忽略,不能忽略的在页面上标好规范地址,并确保内部链接只指向规范版本。
  4. 限制低价值生成源。内部搜索结果、无限筛选这类页面,优先从不生成开始,比事后屏蔽更干净。
  5. 最后才考虑 robots.txt。它是禁止抓取而不是禁止收录,被挡住的地址如果还有外链,仍可能出现在索引里,只是内容不可控。
顺序上有个原则:先减少无用地址的产出,再谈屏蔽和收口。只在 robots.txt 上加几行,产出源不改,日志里的比例不会有明显变化。

哪些地址其实不用动

不是所有“看起来重复”的抓取都要处理。分页、必要的筛选入口、有独立价值的聚合页,本身承担着发现深层链接的作用,贸然屏蔽可能让新页面失去入口。判断标准可以简单一些:这个地址是否帮助用户或蜘蛛找到别的内容?如果是,就保留。

收口之后看什么

改动上线后不要当天就下结论,抓取和索引都有延迟,观察周期通常按周计算。可以关注三个变化:

  • 目标页面的抓取次数是否上升,而不只是总量变化;
  • 低价值地址的抓取占比是否下降;
  • 新发布页面从被发现到被抓取的时间是否缩短。

如果低价值地址的比例降下来了,新页面的抓取却没有增加,问题多半不在额度分配,而在入口和内链:新页面可能离首页太远,或者根本没有稳定的站内链接指向它。

小结

抓取额度不是靠“催”出来的,而是靠梳理地址结构省出来的。先从日志里分清哪些抓取是必要的、哪些是可以避免的,再按“修状态码、修跳转、处理参数、限制生成源、最后才屏蔽”的顺序动手,比一上来就改 robots.txt 更稳,也更容易看出效果。