很多站点的列表页翻页是自动生成的,平时没人细看,出问题时也不容易察觉。文章列表、产品分类、标签汇总、搜索结果,这些页面往往会生成成百上千个分页 URL。如果处理不当,蜘蛛会把大量抓取配额花在翻页上,真正的内容页反而被挤到后面。
分页最常见的几个坑
1. 翻页靠 JS 渲染,链接抓不到
「下一页」按钮如果只是绑定了一个点击事件,没有可访问的 href,蜘蛛顺着链接走不动,第二页之后的内容基本等于不存在。自查方式很简单:把页面 HTML 源码里的 a 标签筛一遍,看有没有指向第二页的真实链接。
2. 所有分页共用同一个标题
第 1 页到第 20 页标题都是「行业资讯_某某网」,描述也一字不差。这会让搜索引擎难以判断每页的差异,也容易造成同质化。建议标题里带上页码或该页实际覆盖的内容区间,但不要机械地堆砌数字。
3. 把分页的规范链接全部指向第一页
这是比较常见的做法,但代价是第 2 页之后的 URL 很难被单独索引,上面的内容也失去了被发现的机会。更稳妥的是每页自指,让每个分页 URL 对自己的内容负责。
4. 「加载更多」和无限滚动没有留退路
无限滚动体验流畅,但页面 URL 从头到尾不变,新加载的内容没有独立地址。可以在滚动加载的同时更新地址栏参数,或者提供一个「查看全部」的静态分页入口,保证内容有可抓取的路径。
5. 组合参数生成大量空分页
排序、筛选、分页三个参数一叠加,很容易出现内容重复甚至为空的页面。这类 URL 建议用 robots.txt 或参数处理规则挡掉一部分,避免蜘蛛在空页面上反复兜圈。
一份可以照着做的自查清单
- 关掉 JS,检查分页链接是否还能点击、是否还有 href。
- 抽查前 5 页的 title 和 description,看是否完全重复。
- 检查 canonical 是自指还是统一指向第一页,确认这是有意为之。
- 用日志或抓取工具统计分页 URL 的抓取次数占比,超过内容页就需要注意。
- 确认每个内容页至少有一条不依赖翻页的入口,比如分类首页、相关推荐、站点地图。
- 检查空结果页、越界页码是否返回 404,还是返回 200 的空壳页面。
处理时的几个取舍
分页本身不是问题,问题是分页把抓取预算吃光、把内容页埋掉。几个相对稳妥的做法:
- 保留可访问的静态 URL:翻页链接写成标准链接,而不是按钮加事件。
- 每页自指 canonical:除非确认这些分页没有独立价值,否则不要全指向第一页。
- 控制分页深度:深处页码的抓取价值很低,可以在保留用户入口的前提下减少暴露。
- 内容页优先:让每个内容页都有独立、稳定的入口,而不是只能靠翻页找到。
翻页是给用户用的,不是给蜘蛛堆页面的。分页做得越简单直接,抓取路径就越清晰。
怎么判断有没有改善
调整之后,可以观察两件事:一是服务器日志里内容页与分页页的抓取比例是否变化;二是新发布的内容能否较快通过分类页入口被抓到。这些指标不会立刻变化,通常需要观察几周。SEO 没有一改就灵的操作,把结构理顺,收益是慢慢体现的。