网站收录

分页、筛选、排序参数页:哪些该进索引,哪些该留在门外

分页、筛选、排序参数经常把同一批内容拆成一堆相似地址,让索引里塞满重复页面。本文按参数类型区分处理思路:分页该保留、排序该收敛、筛选先看有没有独立搜索需求,并说明 canonical、noindex、robots.txt 各自适用的场景和一套可执行的自查顺序。

网站收录

分页、筛选、排序参数页:哪些该进索引,哪些该留在门外

很多站点在收录上遇到的第一道坎,不是内容写得好不好,而是同一批内容被参数拆成了几十上百个地址。列表页翻页、按价格排序、按分类筛选、再加上会话跟踪参数,每一次点击都会生成一个新 URL。蜘蛛顺着链接一路点下去,索引里很快就堆满了相似度极高的页面。

先分清三类参数页

参数页不是铁板一块,处理方式也不一样:

  • 分页参数(page=2、page=3):内容确实不同,属于独立页面,通常值得收录。
  • 筛选参数(品牌、价格区间、尺寸组合):容易生成大量长尾组合,多数只是同一批商品的重新排列。
  • 排序参数(sort=price、order=desc):内容是同一批,只是顺序不同,几乎没有独立价值。

分页页该怎么处理

分页页承载的是不同的商品或文章,属于正常内容。需要做的是让蜘蛛能顺着翻到后面,而不是把页码当成垃圾参数一刀切掉。

  • 页码用可点击的链接,不要只靠脚本动态加载。
  • 第二页之后的页面保留自指 canonical,不要全部指向第一页。
  • 标题可以带上页码或区间,避免几十个页面标题完全一样。

如果分页页本身没有可索引的内容,只是一个“查看更多”的入口,那它更接近导航功能,收录价值有限。

筛选与排序参数页的判断标准

判断一个参数页要不要放进索引,先问三个问题:

  1. 它有没有自己独立的、用户会去搜的词?比如“3000 元以内的降噪耳机”可能有搜索需求,“按价格从低到高”没有。
  2. 去掉参数之后,页面主体内容是否几乎不变?如果只是顺序或范围变化,重复度就很高。
  3. 它是否会被站内链接稳定指向?没有任何页面链过去的参数页,即使被抓到也难有位置。
参数页的取舍,本质上是问:这个地址能不能独立回答一个真实存在的搜索需求。答案是否定的时候,它更适合留在“可抓取但不收录”的范围里。

常用的几种处理手段

分清楚类型之后,可用的手段并不多,但要用对:

  • canonical:把排序、会话参数指向无参数的主地址。注意它只是提示,冲突时还要看页面自身信号是否一致。
  • robots.txt 禁止抓取:适合那些完全不需要被看到的路径。但被 robots.txt 拦住的地址,搜索引擎也读不到页面上的 noindex。
  • noindex:适合“希望被看到、但不希望被收录”的页面,前提是蜘蛛能抓到页面,才能读到这个标签。
  • 合并参数:把多选筛选做成路径形式的固定组合,减少无意义的组合爆炸。

一个简单的自查顺序

  1. 导出已被收录的参数类 URL,按参数类型分组。
  2. 看每组有没有带来过真实点击;长期零点击且内容重复度高的,优先处理。
  3. 从内链上减少指向低价值参数页的入口,例如默认排序的链接直接指向主地址。
  4. 处理完观察一段时间,再看索引里的数量变化。

参数页处理的目标不是让收录数字变小,而是让索引里留下的地址都是有人搜、有内容、有入口的页面。数量降下来只是结果,不是目的。