搜索抓取

抓取预算的去向:蜘蛛把时间花在哪类 URL 上

蜘蛛的抓取量是一种有限资源。本文从抓取预算分配的角度,梳理哪些 URL 容易吃掉配额、如何通过内链与 Sitemap 把抓取引导到核心页面,并给出用日志做抓取盘点的简单方法。

搜索抓取

抓取预算的去向:蜘蛛把时间花在哪类 URL 上

很多站点运营者会问:蜘蛛一天到底能抓多少页面?这个数字并不固定,它和站点规模、服务器响应速度、内容更新节奏都有关系。更实际的问题不是“能抓多少”,而是“抓到的这些 URL 里,有多少是你真正希望被处理的”。把抓取量当成一种有限资源来分配,比单纯追求抓取次数更有意义。

抓取预算是怎么被分配的

搜索引擎不会提前告诉你配额,但从日志里能观察到大致规律:蜘蛛会按 URL “值得再来看一眼”的程度,安排访问顺序。影响这个判断的因素通常包括:

  • 这个 URL 之前是否返回过 200,内容是否有变化;
  • 它被站内链接指向的次数和位置;
  • 站点整体的更新节奏与历史响应质量;
  • Sitemap 中是否列出了它,以及 lastmod 是否合理。

这些信号叠加在一起,决定了蜘蛛先抓谁、多久回来看一次。它们不是权重公式,而是一组经验性的倾向。

哪些 URL 容易悄悄吃掉抓取量

参数与筛选组合页

颜色、排序、每页条数、追踪参数……同一批商品可以生成几十上百个地址。蜘蛛发现它们不难,难的是它要花时间逐个确认这些页面是不是新内容。多数情况下,它们只是在消耗配额。

无限翻页与日历归档

一个可以一直点下去的“下一页”,或者按日期生成的归档页,数量会随时间线性增长。如果没有给蜘蛛一个明确的终止信号,它会一直顺着走。

大量近似重复的地址

带 www 与不带、带尾斜杠与不带、大小写混用,这些技术层面的重复,会让同一份内容以多个 URL 的身份反复被请求。用规范标签或 301 收敛,能省下不少无谓的抓取。

把抓取量引回有价值的页面

  1. 让重要页面在点击距离上更近,首页或栏目页直接给出入口。
  2. 用内链把发现路径集中到少数核心 URL 上,而不是每个页面平均分配。
  3. 对低价值组合页做收敛:能合并的合并,不能合并的用 robots 或参数处理规则挡掉。
  4. 给翻页设置合理上限,并在列表页上给出清晰的分类入口。
  5. Sitemap 只放希望被抓的地址,别把全站 URL 一股脑塞进去。

服务器响应也在影响抓取节奏

蜘蛛的抓取速度和服务器状态是互相影响的。响应慢、超时多,蜘蛛通常会主动降速,避免给站点造成压力,但代价是单位时间内能抓的 URL 变少。反过来,稳定快速的响应会让它在同样时间里多走一些页面。

需要留意的是:抓取频次上升不等于收录增加。如果被抓的仍然是一批无价值的参数页,那只是把资源花在了同一个地方。

做一次简单的抓取盘点

从服务器日志里筛出蜘蛛的访问记录,按 URL 分组统计请求次数,然后回答三个问题:请求最多的前 100 个 URL 里,有多少是你希望被收录的?哪些栏目页被反复抓但内容几乎没变?哪些新发布的页面在一周内一次都没被访问?

答案往往能直接指出问题所在:要么内链没给到新页面,要么低价值 URL 抢走了注意力。调整之后再看一段时间的日志,观察抓取分布是否发生迁移,比盯着单日的抓取总量更有参考价值。