分类页、列表页带上分页和筛选参数之后,一个栏目在索引里可能裂成几十上百个地址。处理这类 URL,核心不是“全收”或“全砍”,而是分清哪些形态对用户有独立价值。
先分清三类列表 URL
1. 导航型分页
?page=2、/page/2 这类是列表的自然延续。用户会从第一页翻到后面,内容位置明确、形态稳定,通常有明确的翻页入口。
2. 参数组合页
?color=red&size=l&sort=price 这类由筛选、排序、视图叠加出来的地址。组合数量随维度增长,很容易超出网站实际的内容体量。
3. 站内搜索结果页
?q=xxx 这类由用户输入驱动的页面,内容随查询变化,一般没有稳定入口,也很难判断其独立价值。
判断是否值得收录的三个问题
- 有没有人会搜这个地址:有稳定搜索需求的分页或筛选组合,可以保留。
- 内容是否与主列表大量重复:如果第 2 页只是同一批条目的重新排列,独立价值有限。
- 能不能被稳定抓取:数量无上限的 URL 会持续占用抓取资源,挤压真正需要更新的页面。
核对与收口的顺序
- 先看索引里实际存在什么形态。确认被抓的是 /page/2 还是 ?page=2,不同形态的处理办法并不一样。
- 确认入口与内链。分页链接如果只靠 JS 动态生成,或者干脆没有链接,蜘蛛的发现路径就会很不稳定。
- 决定 canonical 指向。想让分页自己收录,就自指;只想保留第一页,就指向第一页。注意不要把不同筛选结果的 canonical 全部指向首页,那等于主动放弃差异化内容。
- 参数组合页优先用 robots.txt 挡抓取,而不是 noindex。noindex 生效的前提是页面能被抓取;如果数量大到抓不完,用 robots 屏蔽更直接,但要接受它无法传递 noindex 信号这一点。
- sitemap 只放你希望收录的形态。把带参数的变体一并提交,等于主动扩大抓取面。
- 观察一到两个抓取周期再调整。一次改太多条件,后续无法判断是哪一步起了作用。
几个容易踩的坑
- 排序参数(?sort=)通常没有独立搜索需求,是重复内容的高发区。
- 分页被 noindex 后,后面几页的条目可能更难被发现,要确认这些条目还有其他入口。
- 移动端与桌面端若使用不同参数,注意同一列表是否被拆成两套地址。
列表类 URL 的处理目标不是让索引数量变少,而是让索引里的地址都能对应到有人需要的页面。
调整后的观察指标
重点看三个方向:被抓取的 URL 总量是否向内容页倾斜;列表页的抓取频率是否稳定;重要条目的发现时间有没有被拉长。如果收录数量下降,但条目的发现速度没受影响,说明收口方向基本是对的。