做商品列表、职位列表、房源列表的站点,过一段时间查收录,常常会发现索引里多出成百上千条地址,点开一看,正文列表大同小异,只是筛选条件不同。这些页面不是垃圾页,但它们的重复度很高,会占掉本该留给更有价值页面的位置。
参数页为什么容易被抓走
原因通常不在蜘蛛,而在入口。列表页往往会给出大量筛选链接,颜色、尺码、价格区间、排序方式排列组合,理论上能生成几万条 URL。搜索蜘蛛顺着这些链接走,只要服务器返回 200 并且不是空列表,它就有理由抓下来。
另一个常被忽略的点是:同一套内容可能有多个参数写法,比如 ?sort=price 和 ?order=asc&by=price 指向同一个结果,URL 却完全不同。这时候收录分散,往往不是因为内容不够,而是地址没有收拢。
先给这些 URL 分三类
别一上来就全部 noindex,容易顺手把有流量的页面也挡掉。更稳妥的做法是先按业务价值分类:
- 该保留的:有稳定搜索需求、能覆盖明确主题的组合,比如“城市+户型”“品牌+型号”。这类页面通常有独立的文案、标题和介绍段落。
- 可留可不留的:结果集较大的通用筛选,比如价格区间、评分排序。它们可以存在,但不值得单独进入索引。
- 该收口的:多重条件叠加后结果很少、甚至为空,以及会话、追踪、排序类参数。这类页面既没有稳定内容,也不适合作为落地页。
分类时可以直接看数据:这个 URL 过去一段时间有没有自然点击?有没有被其他页面链接?如果两者都没有,通常不需要占用索引位置。
收口手段有先后顺序
处理重复 URL,建议按下面的顺序推进,前面的手段能解决,就不急着用后面的。
- 控制入口。把不打算收录的组合从内链里拿掉,改成表单提交或按钮触发,而不是直接输出可点链接。没有链接入口,蜘蛛自然少走。
- 统一地址写法。固定参数顺序,去掉无意义的追踪参数,避免大小写和末尾斜杠造成同页多址。这一步做完再谈后面的处理。
- 用 canonical 归并。让重复的组合页指向主页面,比如把排序、视图切换类参数归到默认地址上。canonical 是提示而不是强制,所以别把它当唯一手段。
- 限制抓取。对结果极大、几乎不产生价值的参数路径,可以在 robots.txt 里做限制,减少抓取占用。但要清楚:被 robots 挡住的页面,如果还有外部链接指向,仍可能以无描述的形式出现在结果里。
- 最后才是 noindex。对确实想留在站内供用户使用、但不希望进入索引的页面,加 noindex 更直接。注意 noindex 的页面要允许抓取,否则标签读不到。
一个常见误区:把 noindex 和 robots.txt 同时用在同一批 URL 上。结果是标签读不到,页面也没被挡住,白忙一场。
分页和视图切换要单独想
分页是列表页的固有结构,通常不需要当作重复内容处理,但要注意别让第一页和带参数的首页地址并存。视图切换(列表视图、网格视图)和排序参数则更适合归并到主地址,因为它们对用户有即时帮助,对搜索却没有独立主题。
打印页、AMP 版、移动独立域名属于另一类情况,处理思路是让它们声明规范版本,而不是简单删掉。
处理完要看什么
收口不是一改就见效的动作,需要看一段时间的变化。可以关注三点:
- 被收口的 URL 是否逐渐从索引中退出,而不是原地不动;
- 保留下来的组合页抓取是否更集中,日志里重复路径是否减少;
- 站内搜索入口是否仍然可用,别为了收口让用户找不到筛选项。
如果发现某个被收口的组合页其实有稳定点击,可以把它重新放开,并补上独立的标题和说明文字。重复内容的处理没有一劳永逸的答案,更多是随业务和数据不断调整的过程。