很多站点在收录上遇到的第一道坎,不是内容写得好不好,而是同一批内容被参数拆成了几十上百个地址。列表页翻页、按价格排序、按分类筛选、再加上会话跟踪参数,每一次点击都会生成一个新 URL。蜘蛛顺着链接一路点下去,索引里很快就堆满了相似度极高的页面。
先分清三类参数页
参数页不是铁板一块,处理方式也不一样:
- 分页参数(page=2、page=3):内容确实不同,属于独立页面,通常值得收录。
- 筛选参数(品牌、价格区间、尺寸组合):容易生成大量长尾组合,多数只是同一批商品的重新排列。
- 排序参数(sort=price、order=desc):内容是同一批,只是顺序不同,几乎没有独立价值。
分页页该怎么处理
分页页承载的是不同的商品或文章,属于正常内容。需要做的是让蜘蛛能顺着翻到后面,而不是把页码当成垃圾参数一刀切掉。
- 页码用可点击的链接,不要只靠脚本动态加载。
- 第二页之后的页面保留自指 canonical,不要全部指向第一页。
- 标题可以带上页码或区间,避免几十个页面标题完全一样。
如果分页页本身没有可索引的内容,只是一个“查看更多”的入口,那它更接近导航功能,收录价值有限。
筛选与排序参数页的判断标准
判断一个参数页要不要放进索引,先问三个问题:
- 它有没有自己独立的、用户会去搜的词?比如“3000 元以内的降噪耳机”可能有搜索需求,“按价格从低到高”没有。
- 去掉参数之后,页面主体内容是否几乎不变?如果只是顺序或范围变化,重复度就很高。
- 它是否会被站内链接稳定指向?没有任何页面链过去的参数页,即使被抓到也难有位置。
参数页的取舍,本质上是问:这个地址能不能独立回答一个真实存在的搜索需求。答案是否定的时候,它更适合留在“可抓取但不收录”的范围里。
常用的几种处理手段
分清楚类型之后,可用的手段并不多,但要用对:
- canonical:把排序、会话参数指向无参数的主地址。注意它只是提示,冲突时还要看页面自身信号是否一致。
- robots.txt 禁止抓取:适合那些完全不需要被看到的路径。但被 robots.txt 拦住的地址,搜索引擎也读不到页面上的 noindex。
- noindex:适合“希望被看到、但不希望被收录”的页面,前提是蜘蛛能抓到页面,才能读到这个标签。
- 合并参数:把多选筛选做成路径形式的固定组合,减少无意义的组合爆炸。
一个简单的自查顺序
- 导出已被收录的参数类 URL,按参数类型分组。
- 看每组有没有带来过真实点击;长期零点击且内容重复度高的,优先处理。
- 从内链上减少指向低价值参数页的入口,例如默认排序的链接直接指向主地址。
- 处理完观察一段时间,再看索引里的数量变化。
参数页处理的目标不是让收录数字变小,而是让索引里留下的地址都是有人搜、有内容、有入口的页面。数量降下来只是结果,不是目的。