分页列表是很多站点收录数量的大头。一个只有几十篇内容的栏目,因为 page/2 到 page/30 都被收录,索引里可能多出几百个 URL。这些页面值不值得占用索引位和抓取预算,需要按目的分开判断,而不是一刀切。
先分清站点里三种像分页的页面
- 列表分页:栏目页第 2、3、N 页,内容是文章列表的下一段。
- 筛选与排序:价格排序、颜色筛选、时间倒序等参数生成的页面,很多站点把它做成了可抓取的链接。
- 滚动加载:前端加载更多,如果同时生成了独立 URL,也会形成类似分页的地址。
三类里,第一类是规划内的,后两类多数是顺带产生的,处理方式并不相同。
分页该不该被收录:看它有没有独立价值
判断标准可以简单一点:这个 URL 有没有可能作为独立结果被点开。列表分页本身通常没有独立搜索需求,用户不会去搜“第 3 页”。但如果分页地址上承载了第一页没有的内容,比如第一页只放置顶和推荐、正文条目从第二页才开始,那它就有被收录的理由。
可以保留收录的情况
- 分页承担了完整内容的分段,每页之间有明确差异。
- 页面有独立的标题、描述和站内导航,能正常作为落地页使用。
- 站点内容体量小,分页数量有限,对抓取预算影响不大。
可以考虑收敛的情况
- 筛选、排序参数页大量重复,只是顺序不同。
- 分页内容与第一页高度重叠,没有独立价值。
- 分页数量远大于内容数量,索引被列表页占满。
几种常见处理方式与它们的副作用
1. 所有分页 canonical 都指向第一页
这是最常见的做法,等于告诉搜索引擎这些页面的内容都属于第一页。结果是分页不进索引、链接信号被合并,一般问题不大。但要确认分页确实没有独立内容,否则第一页会背上不属于它的内容,反而干扰第一页本身的判断。
2. 用 rel=prev / next 标注
这套标注早就不再作为收录信号使用,保留它不会有坏处,但不要指望靠它控制收录。真正起作用的是链接是否可抓取,以及页面上有没有 noindex。
3. 给分页加 noindex
noindex 能阻止页面进索引,但不会阻止抓取。搜索引擎仍会抓取这些页面,以便发现第一页没有的深层链接。所以 noindex 适合内容重复、但不承担发现职责的分页。注意别把 noindex 加到需要被收录的列表入口上。
4. 用 robots.txt 屏蔽分页
屏蔽后搜索引擎不会再抓取,也就看不到分页上的内链。如果站点深处的内容只能通过分页被发现,屏蔽会直接切断这条发现路径。用之前先确认这些 URL 有没有别的入口,比如 sitemap 或其他内链。
一个可以照着走的检查顺序
- 按路径模式统计分页和参数页的数量,看它们在索引里占多大比例。
- 抽查几个分页 URL,确认是否有独立内容、是否真的出现在结果里。
- 检查分页链接是不是真正的 a 标签,而不是 JavaScript 点击事件。
- 确认筛选参数页有没有被无意做成可抓取内链,尤其是排序和每页条数。
- 对确定要收敛的页面,优先用 noindex 或 canonical,最后再考虑 robots.txt。
- 收敛完成后观察一到两个抓取周期,看索引数量和抓取分布的变化。
分页处理的目标不是让分页统统不被收录,而是让索引里留下的 URL 都能承担一个明确的作用。数量下降本身不是坏事。
收敛之后看什么
处理完之后重点观察三件事:索引总量是否下降、深层内容页的抓取是否变多、第一页的展示和点击有没有变化。如果索引下降但深层页面抓取没有增加,说明发现路径被切断了,需要补回站内链接或 sitemap。如果只是索引数字下降、其他指标平稳,通常说明这次收敛是有效的。