一个电商站或内容站,URL 数量最大的往往不是详情页,而是列表页翻到第 2、3、50 页的那些地址。这些页面标题相似、正文只差几条,处理方式一旦一刀切,要么索引被稀释,要么深层内容失去入口。
下面按「先分类、再决定、最后验证」的顺序,说清翻页 URL 的处理边界。
先分清三类翻页 URL
- 频道或栏目首页:通常是聚合入口,自身有独立价值,应当被收录。
- 分页序列:?page=2、/list_2.html、/page/2/ 这类,内容随页码变化,越往后价值越低。
- 筛选与排序产生的组合页:颜色、价格区间、排序方式叠加出的地址,数量可能指数级增长。
第一类不在本文讨论范围;第三类更接近参数页问题,和分页分开处理。真正需要拿捏的是第二类。
翻页 URL 的价值在哪
分页承担两个作用:一是让用户继续往下浏览,二是让蜘蛛顺着链接爬到更深的详情页。第二个作用常被忽略——如果站内没有别的通往深层内容的路径,分页就是那条路。
所以判断标准不是「分页有没有原创内容」,而是「拿掉它之后,深层页面还有没有其他入口」。如果站点地图、相关推荐、标签页已经能覆盖,分页的抓取价值就低;如果深层内容只能靠一路翻页到达,直接掐掉会连抓取路径一起掐掉。
三种常见处理方式与边界
1. 保留可抓取,但不强求收录
最常见的做法:分页 URL 不做 noindex,也不做 canonical 合并,保持 200 状态,链接可跟随,由搜索引擎自行判断要不要收。同时在标题上做一点区分,例如带上「第 3 页」,方便识别序列。
这种方式的问题是会消耗抓取额度,页码越深越明显。可以用限制可翻页深度来抵消:超过一定页码后,链接不再直接出现在 HTML 里,或改成「加载更多」按钮由脚本触发。
2. noindex 分页
当分页内容高度重复、页码极多时,可以给第二页之后的 URL 加 noindex。注意两点:
- noindex 页面上的链接仍可被跟随,前提是不要同时屏蔽抓取,否则标签读不到,页面可能长期留在索引里。
- 不要给第一页加 noindex,也不要一边给全部分页加 noindex,一边指望列表入口本身被收录。
3. canonical 指向第一页
这种做法要谨慎。把 /page/2/ 的 canonical 指向 /page/1/,等于告诉搜索引擎「这几页是同一篇内容」,第一页会被当作聚合视图,但分页上独有的条目可能一起被忽略。
如果分页只是第一页的重复切分,指向第一页尚可;如果每页展示的是不同的条目集合,通常更建议 canonical 指向自身。
翻页之外的两个衍生问题
「查看全部」页面
把所有条目塞进一个长页面,理论上可以合并分页权重,但会让页面体积变大、加载变慢,移动端体验也差。比较稳的做法是保留它但不作为主要入口,或只在条目数量可控的栏目里使用。
无限滚动与加载更多
内容靠脚本追加时,搜索引擎未必会触发滚动。至少要保证分页 URL 真实存在且可访问,让追加部分有一条不依赖交互的抓取路径,否则「加载更多」之后的内容可能一直不被发现。
一个可执行的检查顺序
- 统计站内翻页 URL 的数量级,看它是否占了索引的很大比例。
- 抽查深层详情页,确认除了翻页还有没有其他入口。
- 检查分页的 title、H1 是否有页码区分,是否全部相同。
- 确认加了 noindex 的页面没有被 robots.txt 屏蔽。
- 查看抓取统计,判断翻页消耗了多少抓取量。
- 根据以上结果,在保留、noindex、canonical 合并中选定一种,不要混用。
调整之后不要指望立刻见效,索引的增减通常滞后数周。观察重点也不是分页本身有没有被收录,而是详情页的发现速度有没有变慢、抓取额度有没有腾出来给更重要的页面。
小结
分页 URL 的处理没有统一答案,核心是两条线:抓取路径和索引体积。先确认拿掉分页不会断掉深层内容的入口,再决定它该不该留在索引里。多种信号混用(noindex 加屏蔽抓取再加 canonical 合并)通常比不处理还糟。