列表页翻到第二页、第三页时,会产生一批带页码或参数的 URL。这些 URL 该不该进入索引,很多站点要么全部放开,要么全部屏蔽,结果不是带来大量重复页面,就是把有价值的翻页内容挡在门外。分页 URL 的处理没有统一答案,关键是看翻页内容本身有没有独立价值,以及它对用户和搜索引擎是否构成重复。
分页页面首先服务导航,其次才是内容
分页最常见的形态,是把一长串内容切成若干页。第一页通常承载栏目主题,后续页面只是同一主题下的延续。对用户来说,翻页是浏览路径;对爬虫来说,翻页链接是发现更早或更多内容的通道。因此,即使后续分页不单独收录,也不应阻止抓取。把分页链接改成 JavaScript 点击、按钮或不可抓取的 div,会让更深的条目失去入口,问题比重复收录更严重。
三种常见处理方式,适用场景不同
保留收录
当每一页都有独立、可搜索的内容片段,且页码 URL 稳定、参数简洁时,可以放开收录。比如论坛按时间排序的帖子列表、商品分类下的翻页结果,用户可能直接搜索到某一页里的条目。此时要确保分页有明确的标题、描述和自指 canonical,避免多页共用同一个标题。
用 canonical 收敛到第一页
如果翻页只是同一批内容的重新排列,各页之间高度重复,可以把后续分页的 canonical 指向第一页。这种做法表达的是“首选版本是第一页”,但要注意:canonical 是提示而非强制指令,且第一页本身要能正常抓取。若第一页被 noindex 或屏蔽,后续页面的 canonical 指向会变得矛盾。
对后续分页使用 noindex
当翻页内容没有独立检索价值,又希望保留抓取路径时,可以对第二页及之后使用 noindex,同时保持链接可抓取。这样爬虫仍能顺着分页找到更早的内容,但不会把大量重复 URL 放进索引。需要避免的是对第一页也加 noindex,那会让整个栏目失去索引入口。
哪些分页更适合放开收录
- 每页有独立标题、摘要或不同条目,用户搜索时可能直接命中。
- 分页 URL 结构简单,不叠加排序、筛选、会话等无关参数。
- 内容更新频率高,旧分页会随时间沉淀为可检索的历史记录。
- 站点本身内容量有限,分页数量不大,不会造成索引膨胀。
哪些分页更适合收敛
- 同一批内容只是换顺序,翻页之间差异极小。
- URL 里带有排序、视图、筛选等参数,组合后产生大量近似页面。
- 分页数量极多,且每页只有少量条目,抓取价值低。
- 站点已有更合适的聚合页或专题页承载同类内容。
自查时先看抓取路径,再看索引状态
- 检查分页链接是否可抓取。查看 HTML 中是否有真实的链接指向后续页,而不是仅靠脚本或按钮触发。
- 检查 canonical 是否自指。保留收录的分页,canonical 通常应指向自身;若统一指向第一页,要确认这是有意为之。
- 检查标题与描述是否重复。多页共用同一标题时,搜索引擎难以判断各页差异,收录后也容易互相竞争。
- 检查 noindex 是否误伤第一页。第一页应是栏目入口,通常需要保留索引资格。
- 观察日志与索引状态。看爬虫是否持续访问后续分页,以及已收录的分页是否带来有效点击,再决定放开还是收敛。
分页 URL 的取舍,本质是在“让爬虫走得更深”和“避免重复页面进入索引”之间找平衡。先保证路径通畅,再根据内容差异决定收录范围,比一刀切更稳妥。
最后,分页处理没有永久答案。栏目改版、内容量增长或搜索需求变化后,原先适合放开的分页可能需要收敛,原先屏蔽的页面也可能值得重新评估。定期结合抓取日志、索引状态和页面质量做检查,比一次性设置完就不再过问更实际。