网站收录

列表页翻到第 2 页之后:分页 URL 要不要进索引

列表页的分页 URL 该不该被收录,很难一刀切。本文从重复内容判定、三种分页实现的抓取差异、以及自查顺序几个角度,给出判断分页开放程度的参考做法。

网站收录

列表页翻到第 2 页之后:分页 URL 要不要进索引

列表页、搜索结果页、商品列表的分页 URL,是收录问题里很容易被忽略的一块。有人希望所有分页都被收录,有人干脆全挡住。两种做法都有代价,关键在于分页上的内容对用户是否真的存在独立价值。

分页为什么容易被当成重复内容

第 2 页的标题、副标题、描述经常和第 1 页一模一样,只有条目列表不同。判断时搜索引擎会看整页的文本构成:如果除了几条新条目,其余头部、侧栏、底部推荐完全一致,它很容易被归到近似重复的一类。

  • 标题与 meta 描述完全沿用第 1 页,没有任何区分
  • 第 2 页的条目,在第 1 页的推荐位或侧栏里也出现过
  • 分页序列没有可爬取的链接,只剩一个 JS 按钮

三种分页实现,抓取表现不一样

传统链接分页

每一页都有真实的 a 标签指向下一页,抓取路径最清晰。代价是页面数量多,靠后的分页容易被当成低价值内容。

加载更多与无限滚动

如果“加载更多”是通过请求拉数据再插入页面,蜘蛛拿到的初始 HTML 里可能只有第一屏。没有可点击的链接,后面的内容就很难被发现。稳妥的做法是保留一套可跳转的链接,哪怕它放在页面底部不那么显眼的位置。

分页叠加筛选参数

分页和筛选条件叠在一起时,URL 数量会成倍增长。这类组合页面的收录价值通常偏低,还容易稀释整站的抓取预算。常见的处理是让主要分页保持可抓取,把筛选组合收敛成少数几个真正有搜索需求的入口。

判断要不要收录的几条参考

  • 用户很少会搜“第 5 页”,但会搜第 5 页里的某个具体条目,那些条目应该由详情页来承载
  • 第 2 页之后是否还有独有文案、独有分类说明?有,收录价值就高一些
  • 分页是否会因为库存变化频繁出现或消失?变动越频繁,索引越不稳定
  • 站点规模:几百个分页可以放,上百万个分页通常要收着放

自查顺序

  1. 查看分页 URL 返回的初始 HTML 里,有没有指向下一页的链接
  2. 核对分页的标题与描述,是否与第 1 页完全重复
  3. 在服务器日志里看搜索引擎实际抓了多少分页,占比是否异常
  4. 抽查几个分页在索引里的落地版本,是否落到了第 1 页或某个筛选页
  5. 再决定这批分页是保留、收敛,还是加 noindex
分页本身不是问题,“每一页都长得一样还都想被收录”才是问题。

小结

分页 URL 的处理没有统一答案。比较可靠的做法是:让详情页承担收录任务,让列表页承担发现任务;分页保留可抓取的链接路径,但不必强求全部进索引。当发现分页大量被索引、而详情页迟迟不进的时候,通常说明抓取预算被低价值页面占住了,这时该回头看看列表和分页的开放程度是否合理。