列表页、商品列表、文章归档页往往带翻页。分页内容既不是完全没价值,也不值得全部进索引,处理方式取决于它承担的作用:是让用户和蜘蛛顺着链接一直往下走,还是仅仅作为浏览入口的补充。先把页面价值和 URL 形态分清楚,再决定哪些留、哪些挡。
先分清分页的三种形态
- 静态翻页链接:第二页、第三页各有独立 URL,链接写在 HTML 里能被直接抓到。
- 加载更多 / AJAX 翻页:点击按钮后由 JS 追加内容,地址栏可能不变,也可能用 history API 改成新地址。
- 无限滚动:滚动到底自动加载,页面地址始终不变,后续内容对蜘蛛默认不可见。
形态不同,核对重点也不同:前两种主要看 URL 是否唯一、链接是否可抓;第三种先要解决后续内容能不能被拿到的问题,再谈收录。
按顺序核对这几件事
1. 确认哪些列表页真的需要被发现
不是所有列表页都需要进索引。判断标准可以简单一点:如果一个列表页没有独特的内容概览价值,比如只是按时间倒序堆着全部旧文章,它的作用更多是路径。这类页面保留可抓取、可点击即可,不必强求收录。
2. 检查分页 URL 是否唯一且稳定
常见的情况是同一个第二页存在多种写法:带 page 参数、带 p 参数、路径式翻页、再加排序参数后翻页。多种写法指向同一批内容,就会出现重复地址。核对时按出现频率排一遍,保留一种主写法,其余用 canonical 或直接在内链里统一,而不是全部指望搜索引擎自己归并。
3. 看翻页链接是否真的在 HTML 里
用查看源代码而不是开发者工具确认:翻页按钮如果是 button 加 JS 事件,蜘蛛在初始 HTML 里可能拿不到下一页地址。可行的做法是保留一组真实的 a 标签链接,即使视觉上被样式替换成了按钮。
4. 看抓取与收录结果是否吻合
如果服务器日志里翻页地址被抓取频繁,但索引里几乎没有,通常说明页面被认为价值不高,属于正常现象,不必强行提交。反过来,如果日志里根本看不到翻页地址被抓,先回到第 2、3 步检查链接通路。
5. 定取舍:保留、归并还是挡掉
取舍可以按三点决定:内容概览是否高度重复、用户是否需要单独访问这一页、这一页是否有独立流量价值。三者都不满足时,保留抓取路径、不追求收录,往往是更省事的选择。
常见处理方式与各自代价
- 统一 URL 写法加内链指向主版本:成本低,适合大多数站点,需要持续检查新模板是否又引入了旧写法。
- canonical 指向第一页:翻页内容与第一页高度重复时可用,但第二页以上的独特内容会一并被让出去,要确认没有独立价值。
- noindex 翻页页:能减少低价值页面进索引,但蜘蛛仍会抓取;注意不要和 canonical 混用出矛盾信号。
- robots.txt 屏蔽翻页参数:见效直接,但被屏蔽的地址如果已经在索引里,通常不会因此被移除,需要配合其他手段。
容易被忽略的几个点
- 排序、筛选参数和翻页叠加,会产生大量组合地址,这类地址更适合整体挡掉,而不是逐个处理。
- 翻页页面上的文章摘要有时比正文页更早被收录,这是正常的抓取顺序,不代表内容重复一定有问题。
- 移动端和桌面端的分页地址如果不一致,容易各自形成一套索引,核对时要分开看。
- 列表页数量随内容增长,上线新栏目后要重新检查一遍内链和 URL 规则,而不是一次设置完就放着。
分页的取舍不是能收录就都收,而是先明确这一页承担的是路径还是内容,再决定它的收录目标。目标定清楚了,URL 规范、canonical 和 noindex 的选择才有依据。