不少站点的收录问题并不是出在正文质量上,而是出在一堆带参数的地址上。同一个页面,因为排序方式、追踪来源、筛选条件不同,被生成了几十个甚至上百个地址。蜘蛛抓到的是同一份内容,索引里留下的却是多个入口。要处理这类问题,先分清参数的类型,再决定哪些放行、哪些收敛。
第一步:把参数按用途分成三类
参数名字五花八门,但用途基本逃不出三类:
- 筛选与排序:如 ?sort=price、?color=red、?page=2,它们会改变页面上呈现的结果。
- 追踪与来源:如 ?utm_source=、?from=、?ref=,它们不改变内容,只记录流量来源。
- 会话与状态:如 ?sid=、?sessionid=、?token=,同一用户在不同时刻访问,地址可能都不同。
分类的意义在于:追踪类和会话类参数几乎总是应该收敛,而筛选排序类要看它是否真的产生了有价值的、可以被独立搜索的页面。
追踪参数:优先从源头减少
追踪参数的麻烦在于它极其容易扩散。一次外链投放、一次站内 banner、一次邮件推送,可能就给同一个页面加上了不同的后缀。而站内链接如果直接复制了当前地址,这些参数就会被蜘蛛顺着爬一遍。
处理顺序建议是先管住生成端:分享、投放、内部跳转统一使用不带追踪参数的规范地址,追踪信息用脚本在落地后附加。这样至少不会让参数顺着内链扩散到全站。
筛选与排序参数:判断是否值得成为独立页面
判断标准可以简化成一句话:这个参数组合出来的页面,用户会主动搜索它吗?
- 会:比如品牌加品类的组合,或者有稳定搜索量的规格筛选,可以考虑保留收录,并让它可以被抓取、被内链指向。
- 不会:比如任意颜色、任意价格区间的排列组合,数量按乘法膨胀,单页内容稀薄,通常应当收敛。
当组合数量呈乘法增长时,比较稳妥的做法是只放行少数有明确搜索需求的组合,其余用 canonical 指向主列表页,或者让它从一开始就不产生新的 URL。要留意的是,被 canonical 指向的目标页本身必须可抓取、可正常返回,否则这个信号等于落空。
收敛手段的先后顺序
- 先在生成端控制:前端能完成的筛选尽量不跳转、不改地址。
- 再统一内链:站内链接只指向规范地址,不要把带参数的地址写进导航、面包屑或文章正文。
- 然后用 canonical 指向规范版本,并确认规范版本自身状态正常。
- 最后才考虑 robots.txt 屏蔽或 noindex。屏蔽会让蜘蛛看不到 canonical 提示,这两者的取舍要想清楚。
如果带参数的地址已经被大量收录,不建议一次性全站屏蔽,那样可能连带影响有效页面的抓取额度。更稳的做法是按目录、按参数名分批处理,观察抓取与索引的变化再推进下一步。
处理之后的观察方式
参数收敛不是改完就见效的。可以按参数名分组,观察站点地图里提交的地址数量、蜘蛛对规范版本的抓取频次,以及规范版本自身的索引状态。如果规范版本长期不被抓取,说明内链和入口还没理顺,此时继续叠加 canonical 的意义有限,应该先回头补入口。
把参数分清、把入口理顺,剩下的才是内容质量的问题。反过来,如果参数地址一直泛滥,内容做得再好,也容易被分散到多个索引入口上,看收录表现时自然会失真。