网站收录

列表页翻页与收录:第 2 页之后,哪些 URL 值得留在索引里

列表页一开翻页,URL 数量就成倍增长。第 2 页之后该不该进索引,取决于它是内容递进还是视图切换。本文按这两类场景,给出抓取与收口的分开处理思路,以及一次可执行的自查顺序。

网站收录

列表页翻页与收录:第 2 页之后,哪些 URL 值得留在索引里

列表页、分类页、聚合页一旦开启翻页,URL 数量就会按倍数增长。第 2 页、第 3 页……第 50 页都存在,蜘蛛也能顺着链接一路读下去。但这些地址该不该被抓取,和它们该不该进索引,其实是两个问题。

先分清两种翻页

同样是 ?page=3,背后可能是完全不同的东西:

  • 内容递进型:第 1 页是最新 20 条,第 2 页是更早的 20 条,每一页都有各自不重复的条目。这类分页是内容的组成部分,用户确实会翻到第 5 页去找东西。
  • 视图切换型:排序方式、每页条数、展示模式不同,条目集合基本一致。这类地址更像同一批内容的多个视图。

判断方法很朴素:把两个 URL 的正文列表拉出来对比。重合度高的是视图切换,各取所需的是内容递进。

被抓取不等于要进索引

蜘蛛需要顺着翻页链接走到第 10 页,才能发现那里的一条老内容。如果把深翻页全部屏蔽抓取,等于切断了这条通路。更常见的做法是:放开抓取,但对没有独立价值的深翻页做索引收口,比如加 noindex,或者让它们 canonical 指向第 1 页。

注意顺序:noindex 和 canonical 都要求页面能被抓到才生效。先屏蔽抓取再指望索引消失,往往只会让状态卡在原地。

几种常见处理,各适用什么场景

  1. 分页全部可收录:适合内容量适中、频道页本身有检索需求的站点。前提是每一页都有独立标题和摘要,别让第 3 页的标题还是“XX 列表”。
  2. 第 1 页收录,后续 noindex:适合条目更新快、翻页内容时效性弱的频道。用户搜索时命中的多半是具体条目页,而不是第 7 页列表。
  3. 后续页 canonical 指向第 1 页:适合视图切换型参数。但要确认第 1 页确实能代表这批内容,否则会把有价值的差异信息抹掉。
  4. 无限滚动加分页 URL:滚动加载的部分最好保留可被抓取的链接入口,别只靠点击触发。

深翻页泛滥时的止损动作

如果站内出现大量第 30 页、第 80 页这样的地址,先别急着批量删。可以按这个顺序处理:

  • 把翻页链接的锚文本写清楚,例如“下一页”,而不是一串没有含义的编号。
  • 对确实没有检索需求的深翻页做 noindex,同时保留内链,保证蜘蛛仍能走到更早的条目。
  • 检查是否每个条目都有独立入口。如果某条内容只能通过第 20 页找到,问题不在分页,在于它缺少更直接的链接路径。

一次自查的顺序

  1. 随机挑三个分页 URL,看标题和摘要是否重复。
  2. 确认这些页面是否可被抓取,检查 robots 与返回状态码。
  3. 看它们当前是否在索引里,别只依赖单一指令查询,多做几种方式交叉确认。
  4. 按上面几类场景选一种策略并统一执行,别让不同频道各来一套。
  5. 观察一段时间后再调整,短时间反复改指令会让状态更难判断。

分页处理的本质,是把“蜘蛛需要走的路”和“用户需要搜到的页”分开对待。路要留通,索引不一定要全留。