先分清三种分页,处理方式完全不同
讨论分页收录之前,先给页面定性。同一个站点上,带着“第 N 页”的 URL 至少有三类:
- 内容分页:一篇文章被切成多页,每页都承载正文的一部分。
- 列表分页:栏目、标签、搜索结果的翻页,主要作用是提供更多条目的入口。
- 筛选组合分页:排序、价格区间、地区等参数叠加产生的 URL。
三类页面的检索价值差别很大,混在一起处理,很容易出现该收的没收、不该收的收了一堆。
第 N 页有没有独立检索价值
内容分页
每页都有独立正文,用户的搜索需求也可能落在第 2、3 页上,比如清单类内容的后续条目。这类页面一般按独立页面处理:标题带上页码或小标题,canonical 指向自己,并保证第一页到后续页之间有可点击的链接。
列表分页
价值随页数递减。第 5 页之后通常只是入口集合,用户很少直接搜索到它。这里的核心不是“必须收录”,而是不要挡住它后面条目的发现路径。可以保留可抓取,同时不必强求进入索引。
筛选组合分页
先把参数分类:影响内容集合的,比如地区、品类,尽量做成静态路径;只影响排序和展示的,比如 sort、view,集中收敛,避免无限组合。
核对顺序:从抓取到收敛
- 抓取层:确认第一页能否通过普通可点击链接到达后续页,而不是只靠 JS 按钮或滚动加载。
- 索引层:用站点查询和索引覆盖报告,列出实际进入索引的分页 URL,按上面三类归类。
- 内容层:抽查第 2、3 页的标题与描述是否和第一页重复。如果完全一样,索引里出现替身是必然的。
- 指向层:确认 canonical 指向的是自己还是第一页。指向第一页,等于告诉搜索引擎把权重和展示都归到第一页,深页基本不会被保留。
- 收敛层:确定哪些分页保留入口、哪些标 noindex、哪些走参数收敛。注意 noindex 只影响索引,不影响抓取,路径仍然要通。
几个容易踩的坑
- 把所有分页统一 canonical 到第一页,结果第 2 页之后的条目失去被发现的机会。
- 用 noindex 关闭分页,同时又依赖这些页面把新条目带出去。
- 分页 URL 里混入会话 ID、时间戳等无关参数,同一页出现十几个版本。
- 只检查第一页,没有抽查第 2、3 页的标题和正文模板。
分页收录的关键不是把每一页都收进来,而是让该有入口的页面保持可发现,让只是翻页的页面不占用索引和抓取资源。
落地建议
先做一份分页 URL 清单,按三类打标,再针对每一类确定 canonical、noindex 和参数处理规则。改动后结合抓取日志与索引覆盖报告观察两到四周,重点看新条目被发现的速度有没有变慢,再决定是否调整收敛力度。