做站点运营时,参数 URL 往往是被忽略的一块。用户在站内点一次筛选、换一次排序,或者从广告后台带一个 utm 参数进来,浏览器地址栏就多了一串东西。这些地址蜘蛛也会爬到,于是问题来了:它们该不该进索引?
参数一般从哪来
常见的参数有三类,处理方式完全不同:
- 追踪参数:utm_source、gclid、fbclid 之类。它们改变的是流量来源,不改变页面内容。
- 排序参数:sort=price、order=desc。同一批内容换个排列顺序。
- 筛选参数:color=red、size=40、price_min=100。会真正筛出一部分内容,页面主体确实不同。
前两类通常只是同一个页面的另一种打开方式,第三类可能对应真实的用户需求。判断的依据不是参数本身,而是这个 URL 上的内容是否独立、是否有搜索价值。
参数泛滥会带来什么
如果放任不管,通常会出现几种情况:同一批内容以几十个地址存在,形成近似重复;蜘蛛把抓取额度花在参数组合上,真正需要更新的页面反而来得少;索引里出现大量只有细微差别的地址。这些问题不会立刻表现为流量下跌,但会慢慢让收录结构变得难以判断。
分类处理的思路
追踪参数:尽量统一到干净 URL
带 utm 的地址指向的页面和干净地址完全一样,没有理由让它单独进索引。常见做法是在页面上把 canonical 指向不带追踪参数的版本,站内链接和分享按钮也统一输出干净地址。需要注意,canonical 是建议不是命令,如果差异明显,最好同时保证页面上有指向干净版本的链接。
排序参数:一般不需要独立收录
用户搜的是内容,不是排序方式。这类参数页可以保留可访问性,但不作为独立的收录目标。可以让它 canonical 到默认排序的地址,或者在 robots.txt 里做限制。要注意的是,robots.txt 只能阻止抓取,不能阻止已经进入索引的地址被展示,所以对已经收录的排序页,更稳妥的是先让它可抓取、能读到 noindex,再逐步收敛。
筛选参数:先看有没有搜索需求
筛选参数最需要单独判断。像「某品牌 40 码 跑鞋」这类组合,确实可能有搜索量,值得保留一部分可收录的组合;而颜色加尺码加价格区间的排列组合可能有几千个,绝大多数无人搜。可行的做法是只保留有搜索价值的主力组合,其余不主动暴露链接,也不放 sitemap。
几个可落地的做法
- 先统计参数清单。从服务器日志或搜索后台的抓取记录里,把带参数的地址按参数名归类,看哪些是被大量抓取的。
- 给每个参数定一个策略:归一化、不索引,还是保留收录。
- 调整站内链接输出,避免在列表页、面包屑里生成大量参数链接。
- 检查 sitemap,只保留确定要收录的地址,不要把所有参数组合都提交进去。
- 把被屏蔽的参数页从站内可点击路径中移除,减少蜘蛛反复发现它们的机会。
怎么验证处理效果
处理之后,不要只看一两天的数据。可以观察一段时间内蜘蛛对参数地址的抓取次数是否下降,索引中带参数的地址是否在减少。同时确认目标页面的抓取没有受到影响——如果收缩参数页导致主力页面也来得少了,说明收敛做得过急。
参数本身没有对错,问题在于是否每个组合都值得占用一个索引位置。判断的标准始终是内容差异和搜索需求,而不是参数长得像不像。
如果站点参数体系很复杂,可以从抓取量最大的几个参数入手,先处理最明显重复的那一批,观察一段时间再决定要不要继续收紧。