抓取预算这个词常被说得像一笔固定额度,实际上它更像是排队的结果:搜索引擎根据服务器响应能力、站点整体质量和自身的抓取需求,决定在一段时间内派多少蜘蛛来、抓多少个 URL。你无法直接申请更多,但可以通过减少无效排队、把入口集中到真正重要的页面上,间接改变抓取的去向。
先分清:不是配额,而是优先级竞争
同一时间蜘蛛能发出的请求有限,队列里的 URL 会互相竞争。一个站点如果有几万个参数组合页、筛选页、重复分页,它们不会因为“不重要”就自动排在后面——只要能被发现,就会进入队列并消耗一次抓取机会,同时挤掉一个本可以抓取正文页的名额。
所以核对抓取预算的第一步不是看蜘蛛来了多少次,而是看它把次数花在了哪里。
哪些 URL 容易占用预算
- 带排序、筛选、追踪参数的列表页,同一批内容被生成出大量变体 URL。
- 分页层级过深,翻到第 30 页之后基本没有发现价值,但仍在 Sitemap 或内链里。
- 会话 ID、打印页、分享页等由程序自动生成的副本。
- 内容为空或已下架,却仍返回 200 的软 404 页面。
- 由站内搜索生成的结果页,被内链或外链带出后进入抓取范围。
这些页面往往还有一个共同特征:站内没有真实用户访问路径,链接却存在于某个模板里,于是被长期反复抓取。
Sitemap 与内链,别同时放大同一批 URL
Sitemap 和站内链接是两条独立的发现通道,但它们指向的目标应当一致。常见的问题是:Sitemap 里放了全量商品参数页,导航和筛选组件又把同样的参数页连了一遍,等于用两种方式反复强调“这些都重要”。
更稳妥的做法是让 Sitemap 承担“完整清单”的角色,只收录你愿意被索引的规范化 URL;内链则承担“重要性排序”的角色,把权重压向分类、专题和核心详情页。两者指向冲突时,蜘蛛往往更相信内链与实际访问数据。
回收预算的核对清单
- 用抓取日志按目录、参数模式统计抓取次数,排出前十类最常被抓的 URL 形态。
- 对其中没有检索价值的形态,优先用 robots.txt 屏蔽抓取;注意被屏蔽的 URL 仍可能被索引,必要时配合 noindex,但 noindex 需要页面允许被抓取才会生效。
- 对内容重复的变体,统一到 canonical 目标,并让内链只指向规范版本。
- 把 Sitemap 拆分为核心页与长尾页,核心页保持较高更新频率,长尾页降低提交量。
- 检查分页与筛选组件是否被模板批量输出,必要时改为交互加载,减少可发现的 URL 数量。
- 清理软 404,让已下架页面返回 404 或 410,避免持续被抓。
观察指标与调整节奏
调整之后不要只看蜘蛛总访问量,那个数字可能因为屏蔽而下降,但不代表抓取变差。更值得关注的是:核心目录的抓取占比是否上升、新上线页面的首次抓取时间是否缩短、日志里重复抓取同一 URL 的次数是否减少。
这些变化通常需要几周时间才能在日志里稳定下来,期间不要频繁改动规则,否则很难判断是哪个动作起了作用。
抓取预算优化的目标不是让蜘蛛来得更多,而是让每一次抓取尽量落在有检索价值的 URL 上。
小结
把抓取看成一场排队竞争,思路会清晰很多:减少无意义的 URL 进入队列,把入口和链接集中在核心页面上,再用日志验证抓取结构是否真的发生了位移。这比单纯追求蜘蛛数量更接近问题的本质。