网站收录

带参数的 URL 被大量收录:筛选、排序与跟踪参数的收口顺序

站内索引里常混进一批只差几个字符的地址:utm 分享链接、排序筛选组合、会话参数。本文按参数类型分步梳理,先确认哪些带参地址确实进了索引,再判断该保留还是收敛,最后从站内链接、服务端跳转和 canonical 三条线收口,并说明复查时该看什么指标。

网站收录

带参数的 URL 被大量收录:筛选、排序与跟踪参数的收口顺序

查收录量时,很多站点会发现索引里多出一批只差几个字符的地址:带 utm 的分享链接、带排序参数的列表页、带筛选条件的商品页。它们和无参版本的内容几乎一样,却各自占着一个索引位。处理这类问题,关键不是一刀切屏蔽问号,而是先把参数分好类,再按顺序收口。

第一步:确认被收录的是哪一类参数

同样是问号后面的内容,来源和意图差别很大。可以把索引里多出来的地址拉出来,对照它的入口来源,大致归成几类:

  • 跟踪类:utm_source、gclid、fbclid、spm、from 等,来自投放、分享和站外跳转,页面内容与无参版完全相同。
  • 筛选与排序类:颜色、价格区间、排序方式。少数组合有独立检索需求,大多数只是用户随手点出来的。
  • 分页与会话类:page、p、sid、sessionid 等,多半由程序生成,组合数量可能非常大。
  • 功能类:带 token、预览、打印、导出参数的地址,通常不该出现在公开索引里。

找这些地址时,可以同时用站内搜索语法抽查、站长后台的页面报告按 URL 关键词筛选,以及看服务器日志里被高频抓取的带参路径。三个来源交叉着看,比只看一个数字可靠。

第二步:判断哪些该留、哪些该收

不是所有带参地址都要清掉。判断的依据是:这个地址有没有独立于无参版本的检索价值。

  • 跟踪类参数没有独立价值,统一收敛到无参地址。
  • 筛选类先看数据:有搜索量的少数组合可以保留,单独优化标题与描述;没有搜索量的组合再考虑控制抓取。
  • 功能类地址建议直接禁止抓取,或返回 404、410,不让它们进入索引流程。
noindex 需要页面被实际抓取才会生效。如果同时用 robots.txt 屏蔽该路径,noindex 就永远读不到,两个手段选一个,不要叠在一起用。

第三步:按内链、跳转、声明三条线收口

  1. 先改站内:导航、文章内链、分享按钮、广告素材里去掉跟踪参数,这是源头。
  2. 再做跳转:对确认无价值的跟踪参数,服务端 301 到无参版本。白名单式处理,只跳确定的参数名,不要用正则匹配所有问号。
  3. 补 canonical:保留但不想重复收录的带参页面,canonical 指向无参版本,并保证两边正文一致。
  4. 限制组合爆炸:筛选参数的可选值要有上限,不可共存的参数不要同时出现,避免生成大量空结果地址。
  5. 站内搜索结果页不要开放抓取,这类页面最容易成批进索引。

收口之后看什么

改完不要立刻下结论。索引里的旧地址会存在一段时间,重新抓取和计算都需要周期。建议按两周左右的节奏复查一次覆盖率报告,观察带参地址的数量趋势,同时确认无参版本是否稳定。

如果带参地址在减少,而正文页的抓取量没有明显变化,说明这次收口基本没伤到有效页面;如果连正文页的抓取也一起掉了,回头检查 robots.txt 是不是写得太宽。

最后两点提醒:参数处理是长期维护的事,新增投放、新版筛选功能都可能再带出一批地址;另外别把带参地址消失当成唯一目标,真正要盯的是有效页面能不能被正常抓取和展示。