网站收录

分页页面的收录取舍:第几页开始收敛,怎么判断

分页 URL 要不要收录,没有统一答案。本文从分页的两种形态入手,说明放开与收敛各自的代价,给出可执行的自查顺序和常见处理方式,并列出三个容易踩的坑,帮你判断第二页之后该保留、该收敛还是该只留抓取。

网站收录

分页页面的收录取舍:第几页开始收敛,怎么判断

列表页翻到第二页、第三页,这些 URL 到底要不要被搜索引擎收录?这个问题没有统一答案,因为它同时牵扯两件事:一是更靠后的内容能不能被蜘蛛发现,二是抓取和索引资源会不会被大量相似页面稀释。先判断页面本身的差异,再决定放开还是收敛,比套用某个固定做法更稳妥。

先分清分页的两种形态

一种是传统分页,URL 明确变化,比如 /list?page=2 或者 /list/page/2;另一种是“加载更多”或无限滚动,地址栏不变,内容靠 JS 追加。两者的处理逻辑完全不同。

  • 独立 URL 的分页:每个页码都是一个可访问的地址,蜘蛛可以单独抓取,也存在被单独收录的可能。
  • 无独立 URL 的加载更多:通常只有一个页面地址,后面内容在初始 HTML 里可能并不存在,需要确认渲染后正文是否能被拿到。

如果是第二种,重点应该放在“深层内容有没有别的入口”上,而不是讨论页码收录。

分页 URL 的价值和代价

放开收录的理由很简单:列表页本身是一个强内链聚合,能把深层的详情页更集中地送到蜘蛛面前。当一个栏目的详情页很难通过其他路径被发现时,分页往往是有效的补充入口。

代价也很明显:第 N 页的正文主体基本相同,只有条目列表不同,容易被判为高度相似;页数越多,这种低差异 URL 的占比越高,抓取频率就会被摊薄。很多站点的问题不是“分页没收录”,而是“分页收了一大堆,详情页反而抓得少”。

一个可执行的自查顺序

  1. 确认分页上的条目,是否都能通过其他内链路径到达。能到达,分页的收录价值就低很多。
  2. 看分页 URL 是否被大量参数污染(排序、筛选、追踪参数叠加),先做规范化。
  3. 看第 2 页以后的内容量,如果每页只有五六条摘要,内容稀薄,收敛更合适。
  4. 最后才决定处理方式,并观察一段时间索引与抓取日志的变化,不要频繁来回改。

几种常见处理方式

  • 自引用 canonical:每页指向自己,配合正常的翻页内链,属于默认放开,适合详情页依赖分页发现内容的站点。
  • canonical 指向第一页:把第二页之后都归到列表首页。这样做会让后面的 URL 逐渐退出索引,但如果第一页并不包含后面的条目,用户从搜索结果进入时体验会不一致。
  • noindex, follow:页面不参与索引,但链接仍被跟踪。这是比较常用的折中方案,既保留发现路径,又减少相似页面占用索引。
  • robots.txt 屏蔽抓取:不建议用在分页上。它阻止的是抓取本身,蜘蛛读不到 noindex,一旦已经被收录,反而可能长期留在索引里。
一个常见的矛盾:想用分页帮详情页被发现,又不想让分页自己占索引。noindex, follow 正是为这种需求准备的,但它要求页面仍能被正常抓取。

容易踩的三个坑

  • 把 ?page=1 和列表首页当成两个页面,内容一样却各留一个地址,重复度凭空增加。
  • 分页链接用 JS 点击渲染,初始 HTML 里没有可爬的 a 标签,后面的内容就成了事实上的孤儿。
  • 发现分页被收录后立刻整站 noindex,把原本有效的发现路径一起砍掉,深层页面抓取量反而下降。

观察指标不要只看一个数

改完之后至少盯三样东西:分页 URL 在索引里的数量、栏目详情页的收录比例、以及蜘蛛对该目录的抓取频次。如果分页数量降了,但详情页收录没有受影响,说明收敛方向是对的;如果详情页收录一起掉了,说明被砍掉的是主要发现通道,需要把抓取放回来。

结论可以很简单:如果详情页有稳定的内链路径,分页倾向收敛;如果分页是发现深层内容的主要通道,就保留抓取但控制索引。无论选哪种,改完都要留出观察周期,把索引量、抓取频次和详情页的收录情况放在一起看,而不是只盯分页 URL 的数量。