站点收录数量波动时,很多人第一反应是去看内容够不够、外链多不多,但有一类问题更常见:URL 本身产生得太多、太像,把真正需要被索引的页面淹没了。分页、筛选、排序参数就是典型场景。它们不是错误,但如果全部放开给搜索蜘蛛,收录分散和抓取浪费几乎不可避免。
先分清:不同入口和不同页面不是一回事
同一个商品列表,按价格排序、按销量排序、加上颜色筛选,可能生成几十个 URL。它们展示的是同一批商品,只是顺序或筛选条件不同。对用户来说,切换排序很方便;对搜索引擎来说,这些 URL 看起来都是独立页面。
如果每个参数组合都被抓取和索引,可能出现几个后果:重复内容稀释主版本、抓取预算被大量近似页面消耗、索引里出现大量低价值 URL。反过来,如果一刀切全部屏蔽,也可能让一些有独立搜索价值的筛选页失去被发现的机会。所以要先判断:这个 URL 是同一页面的不同入口,还是真正不同的页面。
分页 URL 怎么处理
列表分页通常是导航路径。第一页有明确主题,后续页是同一主题的延续。常见做法是让分页 URL 可抓取、可索引,但不要把它当成独立内容页去竞争。如果分页内容基本是标题列表,没有额外介绍,把后续分页设为 noindex 或只允许抓取不索引,可以减少索引膨胀。但要注意,noindex 的页面依然应该能被抓取,否则站内链接的发现路径会断。
有些站点把分页 canonical 到第一页,这要谨慎。分页不是重复内容,强行归并可能让搜索引擎误判。更稳妥的是每个分页自我引用 canonical,同时控制后续分页的索引必要性。
筛选和排序参数:按搜索价值决定去留
排序参数一般没有独立搜索价值,比如 ?orderby=price、?sort=desc。这类 URL 建议 canonical 到无参数版本,或者用 robots.txt 阻止抓取。但阻止抓取前要想清楚:如果这些参数 URL 被大量站内链接指向,阻止抓取后搜索引擎看不到 canonical,可能仍会作为索引候选。此时更合适的方式是统一站内链接到无参数版本,再配合 canonical 或 noindex。
筛选参数更复杂。像“品牌+品类”“价格区间+品类”这类组合,如果确实有用户搜索,可以保留一部分有价值的页面,给它们独立标题和描述,并确保内容不是简单罗列。没有搜索需求、只是内部筛选工具生成的参数,则应收敛到主版本。
判断留还是放,可以看这几个信号
- 是否有独立搜索需求:有人搜这个组合词,才值得单独收录。
- 是否与主版本高度重复:标题、正文、商品列表几乎一样,收录意义不大。
- 是否有站内入口:孤立的参数 URL 即使被抓到,也难维持更新。
- 是否消耗抓取预算:日志里大量参数页被反复抓取,但很少带来点击,就要收敛。
- 是否影响主版本识别:多个 URL 内容相同,canonical 又没指对,主版本会不稳定。
操作顺序:先治理入口,再调整索引
- 从日志和 sitemap 里梳理参数类型,分清排序、筛选、分页、追踪参数。
- 确定每个内容集群的主版本 URL,统一站内链接指向它。
- 对无价值参数用 canonical 归并,必要时配合 noindex;不要只依赖 robots.txt。
- 对有价值筛选页保留索引,但检查标题、正文和内链是否足够独立。
- 观察一段时间,看抓取分布和索引状态是否变化,再决定下一步。
收录不是越多越好。把不该收录的 URL 控制住,比事后从索引里清理更省力。
分页、筛选、排序参数本身没有对错,关键看它们是否提供了独立价值。如果只是同一内容的另一种排列,就让它们回到主版本;如果确实满足细分搜索需求,再给它们独立的收录位置。先治理 URL 入口,再谈索引,通常比反复提交 sitemap 更有效。