网站收录

分页列表与筛选参数页被收录:列表类 URL 的取舍顺序

分类页、列表页带上分页和筛选参数后,一个栏目可能在索引里裂成几十个地址。本文按导航型分页、参数组合页、站内搜索结果页三类分别判断,给出从索引形态核对、canonical 指向、robots 与 noindex 选择到 sitemap 提交的收口顺序,并列出排序参数、分页 noindex 后条目发现等常见坑。

网站收录

分页列表与筛选参数页被收录:列表类 URL 的取舍顺序

分类页、列表页带上分页和筛选参数之后,一个栏目在索引里可能裂成几十上百个地址。处理这类 URL,核心不是“全收”或“全砍”,而是分清哪些形态对用户有独立价值。

先分清三类列表 URL

1. 导航型分页

?page=2、/page/2 这类是列表的自然延续。用户会从第一页翻到后面,内容位置明确、形态稳定,通常有明确的翻页入口。

2. 参数组合页

?color=red&size=l&sort=price 这类由筛选、排序、视图叠加出来的地址。组合数量随维度增长,很容易超出网站实际的内容体量。

3. 站内搜索结果页

?q=xxx 这类由用户输入驱动的页面,内容随查询变化,一般没有稳定入口,也很难判断其独立价值。

判断是否值得收录的三个问题

  • 有没有人会搜这个地址:有稳定搜索需求的分页或筛选组合,可以保留。
  • 内容是否与主列表大量重复:如果第 2 页只是同一批条目的重新排列,独立价值有限。
  • 能不能被稳定抓取:数量无上限的 URL 会持续占用抓取资源,挤压真正需要更新的页面。

核对与收口的顺序

  1. 先看索引里实际存在什么形态。确认被抓的是 /page/2 还是 ?page=2,不同形态的处理办法并不一样。
  2. 确认入口与内链。分页链接如果只靠 JS 动态生成,或者干脆没有链接,蜘蛛的发现路径就会很不稳定。
  3. 决定 canonical 指向。想让分页自己收录,就自指;只想保留第一页,就指向第一页。注意不要把不同筛选结果的 canonical 全部指向首页,那等于主动放弃差异化内容。
  4. 参数组合页优先用 robots.txt 挡抓取,而不是 noindex。noindex 生效的前提是页面能被抓取;如果数量大到抓不完,用 robots 屏蔽更直接,但要接受它无法传递 noindex 信号这一点。
  5. sitemap 只放你希望收录的形态。把带参数的变体一并提交,等于主动扩大抓取面。
  6. 观察一到两个抓取周期再调整。一次改太多条件,后续无法判断是哪一步起了作用。

几个容易踩的坑

  • 排序参数(?sort=)通常没有独立搜索需求,是重复内容的高发区。
  • 分页被 noindex 后,后面几页的条目可能更难被发现,要确认这些条目还有其他入口。
  • 移动端与桌面端若使用不同参数,注意同一列表是否被拆成两套地址。
列表类 URL 的处理目标不是让索引数量变少,而是让索引里的地址都能对应到有人需要的页面。

调整后的观察指标

重点看三个方向:被抓取的 URL 总量是否向内容页倾斜;列表页的抓取频率是否稳定;重要条目的发现时间有没有被拉长。如果收录数量下降,但条目的发现速度没受影响,说明收口方向基本是对的。