站点运营

站点运营:筛选与分页参数自查,别让组合地址吃掉抓取配额

筛选、排序、跟踪参数叠加后,一个栏目可能生成成千上万条地址,既稀释内容页权重,也占用抓取资源。本文梳理参数地址的常见来源、索引现状的自查方法,以及 robots.txt、noindex、canonical 与分页处理的适用边界,帮助站点把抓取资源留给真正需要更新的页面。

站点运营

站点运营:筛选与分页参数自查,别让组合地址吃掉抓取配额

很多站点在改版或上线筛选功能之后,地址数量会突然膨胀。原本几百个内容页,几周内变成几万甚至几十万条 URL,其中大部分是排序、筛选、跟踪参数拼出来的组合。这些地址内容高度相似,却各自占用抓取队列,真正需要更新的页面反而排不上。

参数地址为什么会失控

常见来源有三类:

  • 排序与视图参数:如 sort=price、view=list,同一批内容换个顺序就是一个新地址。
  • 筛选组合:颜色、尺寸、价格区间、品牌多选,组合数量是乘法关系,几十个选项就能拼出上万条 URL。
  • 跟踪与会话参数:utm_、from=、ref=、sessionid 等,多出现在外链、广告和站内跳转里。

除此之外,分页参数也很容易出问题。列表翻到第 50 页、第 200 页,如果每一页都允许抓取且没有上限,同样会消耗大量配额。

先做一轮自查

确认哪些参数地址已经进了索引

用 site: 加参数关键词抽查,或者在站点地图与访问日志里统计带问号的 URL 比例。如果占比超过内容页本身,基本可以判断参数已经失控。

区分有需求与纯组合

不是所有筛选页都该被拦。像“某品牌 某型号”这类有明确搜索需求的组合,可以保留为独立页面;而“颜色A + 尺寸B + 排序方式C”这种很少有人主动搜的组合,更适合收敛。

检查跟踪参数是否被当成独立地址

站内链接、分享按钮、邮件里的链接如果随手带 utm 参数,蜘蛛顺着爬就会不断生成副本。

几种处理方式的区别

  • robots.txt 屏蔽:能阻止抓取,但无法阻止已收录的地址继续出现在结果里,而且被屏蔽后搜索引擎也读不到页面上的 noindex。
  • noindex 标签:需要页面能被正常抓取才生效,适合内容真实存在但不想被索引的筛选页。
  • canonical 指向:把参数页指向对应的主列表页,适合内容重复度极高的场景,但它只是一个提示信号。
  • 链接控制:站内尽量不生成无意义的参数链接,从源头减少地址数量,通常比事后处理更省事。
屏蔽、noindex、canonical 解决的是不同问题,混用容易互相打架。比如既在 robots.txt 里 Disallow,又指望 noindex 生效,往往是白忙一场。

分页怎么处理

分页地址通常是规范内容的一部分,不建议一律屏蔽。更常见的做法是:

  1. 分页页 canonical 指向自身,而不是全部指向第一页,否则第一页之外的列表内容很难被单独评估。
  2. 给分页设置合理上限,或者把深层翻页改成“加载更多”,同时保证有一个可抓取的主链接通道。
  3. 列表页本身保持稳定,避免每翻一页就更换排序参数。

验证与后续观察

调整之后,对比调整前后的抓取日志:带参数的请求比例是否下降,内容页的抓取频次是否上升。同时留意覆盖率报告里“已排除”类别的变化,确认没有被误伤的页面。参数治理不是一次性工作,新增功能、投放活动、模板改版都可能重新引入参数,建议把它写进上线检查项里。