很多站点在收录上的麻烦,不是出在页面本身,而是出在 URL 上多出来的那串问号参数。同一批商品或文章,因为筛选、排序、来源追踪,被识别成几十上百个地址,抓取配额被摊薄,规范页也分散到各处,之后再谈收录就变得很别扭。
先把参数按用途分成几类
不同参数的意图不一样,处理方式也不该一样。动手之前先做一次归类,通常比直接上规则更省事。
- 追踪类:utm_source、gclid、fbclid、ref 之类,只记录来源,不改变页面内容。
- 排序类:sort、order、by,只改变展示顺序,内容集合基本一致。
- 筛选类:颜色、价格区间、品牌等,可能组合出大量地址,其中少数组合有真实搜索需求。
- 分页与会话类:page、sid、sessionid,属于浏览过程中的状态。
三类处理手段,各管一段
robots.txt 用来挡抓取
Disallow 只能阻止抓取,不能保证页面不进索引。如果某个带参数的地址已经被外链引用过,屏蔽抓取之后反而可能留下一个拿不到内容、没有摘要的结果。它适合处理确定无价值、也不想再被抓的地址。
canonical 用来表达“同一份内容”
canonical 适合追踪参数、排序参数这类页面主体完全一致的情况。前提是主版本本身可抓取、可索引,并且站内链接也指向它,否则指向关系容易被忽略。
noindex 与参数处理工具用来做收敛
对确实有内容、但不值得单独占一个索引位的长尾组合,比如“红色加 XL”这种筛选,可以考虑 noindex,follow,让链接关系还能在页面之间流动。平台提供的参数处理设置适合整类收敛,但它是信号而不是指令,落地后仍要观察实际效果。
一套可执行的排查顺序
- 从服务器日志或抓取统计里,拉出一段时间内被抓取次数最多的带参数地址。
- 按上面四类打标,看每一类各占多少抓取比例,先处理占比最大的一类。
- 追踪参数在模板层统一清掉:内链、分享按钮、邮件、广告落地页都不带。
- 排序参数统一 canonical 到默认顺序的版本,并保证默认版本可抓取。
- 筛选参数按有无搜索需求分组,有量的保留少数组合并给到内链入口,没有的收敛掉。
- 改完之后留出一个观察窗口,不要当天再叠新规则,否则分不清是哪一步起的作用。
观察这几个指标
- 抓取请求中带参数地址的比例是否下降。
- 主版本地址的抓取频次和抓取深度是否回升。
- 索引状态里,同一份内容是否逐渐集中到主版本上。
内链是收敛的最后一公里
规则改完,如果站内链接仍然到处带着参数,抓取入口就还是散的。列表页、面包屑、相关推荐、上一页下一页,这些位置的链接最好统一成不带追踪参数的干净地址。这一步做完,前面的设置才有稳定的落点。
参数治理的目标是把抓取和索引集中到真正有价值的地址上,它不承诺页面一定被收录,也不代表索引数量会立刻发生变化。
这件事更适合当成长期维护来做:新上线的模板、新加的投放链接,都可能重新带回参数。把它写进上线检查项,比事后一次性大扫除更省力。