网站收录

分页被大量收录:第2页之后该不该留在索引里

分页是站点里最容易被批量收录的一类 URL,翻到第 8 页、第 20 页都进索引并不罕见。本文从内容独立价值、规范目标、抓取成本三个角度,梳理分页该保留、该收口还是该限制生成的判断标准,并给出一套从搜索表现、日志到参数规则的排查顺序,帮助把抓取与索引额度用在更值得的页面上。

网站收录

分页被大量收录:第2页之后该不该留在索引里

做站点运营的人经常会遇到一个现象:详情页没几条进索引,分页列表却一条接一条被收录,翻到第 8 页、第 20 页依然能在搜索结果里看到。这不一定是坏事,但如果不加区分地放任,索引里会堆积大量低价值 URL,真正需要被发现的页面反而被稀释。

分页为什么容易被大量收录

分页有几个天然优势:链接数量多、层级浅、更新频繁、指向它的内链稳定。对搜索引擎来说,这类 URL 发现成本很低,抓取也很顺。相反,一个新详情页可能只挂在列表页底部,还要经过若干层跳转才能被发现。抓取机会的分配本身就不均衡,收录结果自然也会偏。

这里要区分两件事:抓取是过程,收录是结果。爬虫来了很多次,不代表页面一定进索引;内容质量、重复程度、是否被规范到别的 URL,都会影响最终取舍。

分页去留的判断维度

一看内容是否自成一体

如果分页上除了标题和日期,只有一串链接,内容与第 1 页高度重合,它的独立价值就很有限。反过来,有些分页承担了真实的浏览需求,比如按时间归档、按分类翻页,用户确实会一页页看下去,那就不必急着收口。

二看是否有更合适的规范目标

同一组分页可以用 canonical 指向系列首页,让搜索引擎知道这些 URL 属于同一组内容。但要注意:规范标签不等于删除,也不保证会被完全采纳,它只是表达偏好。指向一个不相关或已 404 的地址,反而会制造新的问题。

三看抓取成本与索引规模

如果站点能组合出几十万个筛选与翻页 URL,抓取预算会被大量消耗在翻页上,新内容与重要页面的发现速度就会变慢。这时问题往往不是「要不要收录分页」,而是「要不要让这么多分页 URL 被生成出来」。

常见的处理思路

  1. 保留可控分页:只保留有真实浏览价值的翻页,例如分类页的前几层。
  2. 限制无限翻页:用「加载更多」或只保留前若干页可点,避免生成到第 100 页。
  3. 收敛参数:排序、视图切换等参数尽量统一,不为每种组合生成独立可索引地址。
  4. 规范到系列首页:对确定为同一组的分页给出统一规范目标,并保持该目标可访问。
  5. 让列表保持更新:如果翻页只是把旧内容反复重排,长期价值会持续下降。

动手前的自查顺序

  1. 先看搜索表现:分页是否有真实的展示与点击,还是只是躺在索引里。
  2. 再看日志:爬虫在分页上花了多少请求,占总量比例如何。
  3. 检查参数生成规则:是否存在可以组合出大量 URL 的入口。
  4. 确认 canonical 与 robots 设置是否指向可用地址,避免自相矛盾。
  5. 改完之后留出观察期,索引变化通常不会立刻发生。
把分页当成「有内容的页面」还是「导航的延伸」,决定了你该保留它还是收口它。判断标准应该是用户会不会真的用它,而不是搜索引擎有没有收录它。

容易踩的坑

  • 直接用 robots.txt 封掉分页,导致爬虫无法顺着链接发现更深的详情页。
  • 把所有分页都规范到第 1 页,结果第 1 页承载了过多本不属于它的词。
  • 只盯着收录数量,不看这些页面实际带来了什么。

分页被收录本身不是错误,它只是需要被纳入整体策略来管理。先明确哪些分页有独立价值,再决定保留、合并还是限制生成,比单纯追求「收录多」或「收录少」更有意义。