网站收录

分页列表页的收录安排:第 2 页以后要不要进索引

分页页面既承担把蜘蛛带向详情页的任务,也可能是用户直接使用的入口。本文把有检索价值的列表和纯导航型分页分开讨论,比较保持可抓取、加 noindex、用 robots.txt 屏蔽三种做法的代价,并说明加载更多、无限滚动场景下的链接处理与自查顺序。

网站收录

分页列表页的收录安排:第 2 页以后要不要进索引

分页是站点里最容易被忽略的一类 URL:数量多、结构相似、内容重复度高,既承担着把蜘蛛带到深层详情页的任务,又常常被当成“没有价值”的页面直接砍掉。这两种身份混在一起判断,很容易做出前后矛盾的操作。

先想清楚:分页页面对用户有没有用

判断一个分页 URL 该不该进索引,起点不是“它重复不重复”,而是“用户能不能把它当成一个入口”。同样是 /list?page=3,两种情况差别很大:

  • 有独立检索价值的列表:分类页、栏目页、按时间归档的文章列表。用户会直接搜索某个分类下的内容,这类分页被收录是有意义的。
  • 纯导航型的分页:站内搜索结果页、按价格或销量临时排序的列表、标签组合页。用户几乎不会把这些地址当作入口,它们的主要作用是让蜘蛛继续往下爬。

三种常见处理方式,各自的代价

保持可抓取,页面自引用 canonical

这是最省事的做法:第 1 页指向自己,第 2 页也指向自己,不做跨页 canonical。好处是链接关系完整,蜘蛛可以通过分页导航继续深入;代价是索引里会多出一批相似页面,需要接受这种冗余。

给分页加 noindex

noindex 能阻止分页进索引,但它不阻止抓取,页面里指向详情页的链接依然可以被跟随。真正的风险在于:如果分页是详情页唯一的内链入口,长期看会削弱这部分内容的发现效率。做法上,先确认详情页还有其它入口(分类页、相关推荐、sitemap),再考虑对深层分页做收敛。

用 robots.txt 或参数屏蔽

直接屏蔽分页地址,通常比 noindex 更激进:蜘蛛连页面都读不到,也就看不到里面的链接。除非这些分页确实不携带任何新 URL,否则不建议把它当成默认选项。

分页页的价值往往不在它自己,而在它指向的下一页和详情页。动手之前先确认:拿掉它之后,蜘蛛还有没有别的路走进来。

“加载更多”和无限滚动要额外处理

用按钮加载或无限滚动的列表,用户滚动时看到的内容,蜘蛛不一定看得到。常见的补救方式有两种:一是按钮本身用真实的 a 标签指向下一页地址,而不是纯 JS 事件;二是保留一套可抓取的分页地址作为备份,滚动只是前端的呈现方式。如果页面完全依赖 JS 渲染出后续内容,就要确认渲染后的 HTML 里确实出现了对应的链接。

和详情页的内链一起考虑

  • 详情页之间、详情页到分类页的回链,能降低整站对分页链路的依赖。
  • sitemap 里放详情页地址,可以让发现路径不完全依赖列表翻页。
  • 分页数量很多时,优先保证前几页可抓取,深层分页可以收敛。

自查顺序

  1. 列出所有带分页参数的 URL 形态,确认是否有多种写法指向同一页。
  2. 看这些页面是否有站内或外部入口,还是只靠“下一页”串联。
  3. 确认详情页除了分页还有哪些入口,判断分页是否不可替代。
  4. 检查按钮和滚动加载是否输出了真实链接。
  5. 决定哪些分页保留、哪些加 noindex、哪些干脆不生成。
  6. 改完之后观察一段时间,看详情页的发现和收录有没有变化。

分页处理没有统一答案,关键是把“给用户用的入口”和“给蜘蛛用的通道”分开评估,再决定它要不要出现在索引里。