网站收录

分页的第 N 页该不该被收录:先给分页定个性,再决定怎么收敛

分页页面的收录问题,往往不是收不进来,而是不同类型混在一起处理。本文先把内容分页、列表分页、筛选组合分页分开定性,再给出从抓取层到收敛层的核对顺序,并列出统一 canonical、用 noindex 关分页等常见误区,帮站点在保留入口和控制索引之间找到平衡。

网站收录

分页的第 N 页该不该被收录:先给分页定个性,再决定怎么收敛

先分清三种分页,处理方式完全不同

讨论分页收录之前,先给页面定性。同一个站点上,带着“第 N 页”的 URL 至少有三类:

  • 内容分页:一篇文章被切成多页,每页都承载正文的一部分。
  • 列表分页:栏目、标签、搜索结果的翻页,主要作用是提供更多条目的入口。
  • 筛选组合分页:排序、价格区间、地区等参数叠加产生的 URL。

三类页面的检索价值差别很大,混在一起处理,很容易出现该收的没收、不该收的收了一堆。

第 N 页有没有独立检索价值

内容分页

每页都有独立正文,用户的搜索需求也可能落在第 2、3 页上,比如清单类内容的后续条目。这类页面一般按独立页面处理:标题带上页码或小标题,canonical 指向自己,并保证第一页到后续页之间有可点击的链接。

列表分页

价值随页数递减。第 5 页之后通常只是入口集合,用户很少直接搜索到它。这里的核心不是“必须收录”,而是不要挡住它后面条目的发现路径。可以保留可抓取,同时不必强求进入索引。

筛选组合分页

先把参数分类:影响内容集合的,比如地区、品类,尽量做成静态路径;只影响排序和展示的,比如 sort、view,集中收敛,避免无限组合。

核对顺序:从抓取到收敛

  1. 抓取层:确认第一页能否通过普通可点击链接到达后续页,而不是只靠 JS 按钮或滚动加载。
  2. 索引层:用站点查询和索引覆盖报告,列出实际进入索引的分页 URL,按上面三类归类。
  3. 内容层:抽查第 2、3 页的标题与描述是否和第一页重复。如果完全一样,索引里出现替身是必然的。
  4. 指向层:确认 canonical 指向的是自己还是第一页。指向第一页,等于告诉搜索引擎把权重和展示都归到第一页,深页基本不会被保留。
  5. 收敛层:确定哪些分页保留入口、哪些标 noindex、哪些走参数收敛。注意 noindex 只影响索引,不影响抓取,路径仍然要通。

几个容易踩的坑

  • 把所有分页统一 canonical 到第一页,结果第 2 页之后的条目失去被发现的机会。
  • 用 noindex 关闭分页,同时又依赖这些页面把新条目带出去。
  • 分页 URL 里混入会话 ID、时间戳等无关参数,同一页出现十几个版本。
  • 只检查第一页,没有抽查第 2、3 页的标题和正文模板。
分页收录的关键不是把每一页都收进来,而是让该有入口的页面保持可发现,让只是翻页的页面不占用索引和抓取资源。

落地建议

先做一份分页 URL 清单,按三类打标,再针对每一类确定 canonical、noindex 和参数处理规则。改动后结合抓取日志与索引覆盖报告观察两到四周,重点看新条目被发现的速度有没有变慢,再决定是否调整收敛力度。