网站收录

翻页和列表页的收录处理:第 2 页之后要不要进索引

列表页和翻页是蜘蛛发现内容的主要入口,但页数一多就容易产出大量近似、低价值的 URL。本文拆解传统翻页、无限滚动、view-all 等常见形态的收录取舍,并给出先看数据还是先改链接的判断顺序。

网站收录

翻页和列表页的收录处理:第 2 页之后要不要进索引

站内的列表页、分类页和翻页,是蜘蛛发现新内容最主要的通道之一。一个栏目往下翻二十页,就多出二十个 URL;资讯、电商、论坛类站点很容易在不知不觉中把索引撑大。问题不在于要不要有列表页,而在于哪些翻页 URL 值得留在索引里。

列表页和翻页各自承担什么角色

列表第一页通常同时是导航入口和内容摘要,有独立标题、相对稳定的内容,多数情况下值得收录。第 2 页及以后,内容主体往往是同一批条目的重新排序,页面价值明显下降,但它仍然是蜘蛛往深处爬的路径。所以抓取和收录要分开看:可以让蜘蛛爬,不代表一定要让它进索引。

值得留在索引里的翻页

  • 页面本身有可读内容,例如带摘要、带筛选说明,而不是只有标题列表;
  • 该页是站内少数几条通向深层内容的路径,去掉之后部分页面会变成孤岛;
  • URL 稳定、参数简洁,内容不随访问者身份变化。

不值得留在索引里的翻页

  • 由排序、筛选参数组合出来的近似页,同一批商品换一种顺序就是一个新 URL;
  • 内容基本是标题堆叠,用户落地后还得再点一次才能看到正文;
  • 由加载更多动态拼接出来、本身没有独立入口的页面。

常见分页形态怎么处理

传统 ?page=2 式翻页

保持可抓取,让蜘蛛能顺着链接继续往下走。同时判断这批 URL 是否值得单独收录:如果页面内容高度重复,可以用 canonical 指向序列中的规范形态,或对靠后的页码使用 noindex,把抓取和索引的意图分开表达。

无限滚动和加载更多

滚动加载的内容在初始 HTML 里往往没有对应链接,不执行脚本的抓取就到此为止。建议保留一份可点击的分页链接作为兜底,让抓取能沿着真实链接往下走,而不是依赖脚本触发。

view-all 合并页

把多页内容合并成一页,理论上能减少重复 URL,但内容量一大,页面会变得很长、加载变慢,用户和抓取都未必受益。条目数量可控时可以用,量大时更适合保留分页结构。

先用数据自查,再决定改什么

  1. 看日志或后台数据里蜘蛛的抓取分布,估算翻页占用了多少抓取量;
  2. 抽查若干翻页 URL 的收录情况和落地内容,判断是重复还是各有用途;
  3. 区分是抓取浪费还是索引膨胀,两者处理方式不同,不要一起动手;
  4. 改动后观察一到两个抓取周期,再决定是否加第二步调整。
翻页是否被收录,最终是搜索引擎自己做的取舍。你能做的是把信号说清楚:哪些页是内容页,哪些只是通往内容页的路径。

分页没有统一答案。同一站点里,栏目翻页和筛选翻页的处理方式也可以不同。关键是别让近似页面互相竞争,也别为了省索引而把蜘蛛挡在通往深层内容的路上。