网站收录

带参数的 URL 该不该收录:筛选、排序和追踪参数的处理思路

用户点一次筛选、换一次排序、从广告后台带一个追踪参数进来,地址栏就多出一串字符,蜘蛛同样会爬到这些地址。这篇文章把参数分成追踪、排序、筛选三类,分别给出归一化、屏蔽和保留收录的处理思路,并说明怎么验证处理效果。

网站收录

带参数的 URL 该不该收录:筛选、排序和追踪参数的处理思路

做站点运营时,参数 URL 往往是被忽略的一块。用户在站内点一次筛选、换一次排序,或者从广告后台带一个 utm 参数进来,浏览器地址栏就多了一串东西。这些地址蜘蛛也会爬到,于是问题来了:它们该不该进索引?

参数一般从哪来

常见的参数有三类,处理方式完全不同:

  • 追踪参数:utm_source、gclid、fbclid 之类。它们改变的是流量来源,不改变页面内容。
  • 排序参数:sort=price、order=desc。同一批内容换个排列顺序。
  • 筛选参数:color=red、size=40、price_min=100。会真正筛出一部分内容,页面主体确实不同。

前两类通常只是同一个页面的另一种打开方式,第三类可能对应真实的用户需求。判断的依据不是参数本身,而是这个 URL 上的内容是否独立、是否有搜索价值

参数泛滥会带来什么

如果放任不管,通常会出现几种情况:同一批内容以几十个地址存在,形成近似重复;蜘蛛把抓取额度花在参数组合上,真正需要更新的页面反而来得少;索引里出现大量只有细微差别的地址。这些问题不会立刻表现为流量下跌,但会慢慢让收录结构变得难以判断。

分类处理的思路

追踪参数:尽量统一到干净 URL

带 utm 的地址指向的页面和干净地址完全一样,没有理由让它单独进索引。常见做法是在页面上把 canonical 指向不带追踪参数的版本,站内链接和分享按钮也统一输出干净地址。需要注意,canonical 是建议不是命令,如果差异明显,最好同时保证页面上有指向干净版本的链接。

排序参数:一般不需要独立收录

用户搜的是内容,不是排序方式。这类参数页可以保留可访问性,但不作为独立的收录目标。可以让它 canonical 到默认排序的地址,或者在 robots.txt 里做限制。要注意的是,robots.txt 只能阻止抓取,不能阻止已经进入索引的地址被展示,所以对已经收录的排序页,更稳妥的是先让它可抓取、能读到 noindex,再逐步收敛。

筛选参数:先看有没有搜索需求

筛选参数最需要单独判断。像「某品牌 40 码 跑鞋」这类组合,确实可能有搜索量,值得保留一部分可收录的组合;而颜色加尺码加价格区间的排列组合可能有几千个,绝大多数无人搜。可行的做法是只保留有搜索价值的主力组合,其余不主动暴露链接,也不放 sitemap。

几个可落地的做法

  1. 先统计参数清单。从服务器日志或搜索后台的抓取记录里,把带参数的地址按参数名归类,看哪些是被大量抓取的。
  2. 给每个参数定一个策略:归一化、不索引,还是保留收录。
  3. 调整站内链接输出,避免在列表页、面包屑里生成大量参数链接。
  4. 检查 sitemap,只保留确定要收录的地址,不要把所有参数组合都提交进去。
  5. 把被屏蔽的参数页从站内可点击路径中移除,减少蜘蛛反复发现它们的机会。

怎么验证处理效果

处理之后,不要只看一两天的数据。可以观察一段时间内蜘蛛对参数地址的抓取次数是否下降,索引中带参数的地址是否在减少。同时确认目标页面的抓取没有受到影响——如果收缩参数页导致主力页面也来得少了,说明收敛做得过急。

参数本身没有对错,问题在于是否每个组合都值得占用一个索引位置。判断的标准始终是内容差异和搜索需求,而不是参数长得像不像。

如果站点参数体系很复杂,可以从抓取量最大的几个参数入手,先处理最明显重复的那一批,观察一段时间再决定要不要继续收紧。