做收录核对时经常会遇到一种情况:站点真正的内容页只有几百个,索引里却冒出几倍的地址,点开一看大多是带参数的版本——问号后面跟着筛选条件、排序方式或者来源标记。这些地址通常都能正常打开,内容也相关,所以既容易被收录,也不容易一眼判断该不该处理。
先按参数的作用分类,而不是按参数名
参数名千奇百怪,但作用大致就那么几种:
- 改变内容的参数:筛选条件、排序方式、分页位置、价格区间等。换一个值,页面上出现的文章或商品列表就会不同。
- 不改变内容的参数:来源跟踪(utm 系列、广告点击 ID)、会话标识、展示偏好(每页条数、列表还是网格)。换一个值,用户看到的主体内容基本一样。
- 混合型:同一个参数名,有时参与筛选,有时只是默认值。比如排序参数在取默认值和不传时结果完全相同。
分类的意义在于:决定怎么收敛时,判断依据应该是“这个参数会不会产生实质不同的内容”,而不是“参数名叫什么”。同样是 utm,如果它被写进了服务端渲染并且真的改变了页面正文,也要单独拎出来看。
在收录核对里量一遍,而不是凭印象
凭感觉说“参数页太多了”没有意义,落到数量上才好决策:
- 抽一批已收录的带参数地址,按参数名分组,看每一组在总收录量里占多大比例。
- 对每一组挑几个地址打开对比:标题、正文、主要链接有没有变化。
- 看这些地址有没有内链入口、有没有出现在 sitemap、有没有被外部链接引用。
- 顺手记一下参数顺序问题:?a=1&b=2 和 ?b=2&a=1 如果返回同一页内容,本质上也是重复地址,容易在统计里被算成两组。
量完之后通常会发现,真正需要处理的是其中一两组,而不是全部参数。
常见收敛手段和各自的边界
- canonical 指向无参数版本:适合参数不改变内容的情况。如果参数确实改变内容,指向无参数版会造成页面内容与 canonical 声明不一致。
- robots.txt 屏蔽:对阻止抓取有效,但已经进过索引的地址通常不会因为屏蔽而立刻消失,需要配合其他方式。
- meta robots noindex:前提是页面能被抓取到,才能读到这条指令,所以不能同时在 robots.txt 里把它挡住。
- 站长平台的参数处理工具:可以声明某个参数不改变内容,但声明必须和站内实际行为一致,别把筛选参数也一起声明掉。
- 从源头减少:内链、分享按钮、广告落地页尽量指向规范地址,否则一边收敛一边又产生新的入口。
动手前先确认三件事
- 站内有没有指向参数版的链接?如果有,先把这些链接改成规范地址,不然收敛的效果会被不断新增的入口抵消。
- 参数是服务端生成还是前端脚本拼上的?前端拼出来的参数,蜘蛛拿到的原始 HTML 里可能根本没有,处理方式完全不同。
- 收敛之后隔几周再抽查一次:参数页减少是预期的,但要确认真正的内容页收录没有跟着一起掉。
参数地址不一定要全部消灭。判断标准是:它有没有提供别处没有的内容,以及用户和蜘蛛是否会从正当入口到达它。
把这件事当成一次分类统计,而不是一次批量清理,参数地址带来的困扰通常会小很多。