网站收录

分页 URL 被大量收录:页码序列的取舍与收敛顺序

列表页翻页后产生的 ?page=2、/page/3 这类 URL,很容易被蜘蛛顺着“下一页”链接一路抓取,最后在索引里留下一长串页码页。本文按 URL 统一、内链收敛、收录策略、抓取预算的顺序,说明哪些分页值得保留、哪些适合收敛,以及几个常见做法的坑。

网站收录

分页 URL 被大量收录:页码序列的取舍与收敛顺序

列表页翻到第二页、第三页,URL 往往变成 ?page=2、/page/3 这样的形式。这些分页 URL 很容易被蜘蛛顺着“下一页”链接一路抓下去,最后在索引里留下一长串页码页面。它们既不算完全无用,也很难说是优质内容,处理起来需要先判断,再决定留还是收。

分页页为什么容易被大量收录

原因通常出在发现路径上。分页链接是站内最密集、最容易递归的一类链接:第一页链到第二页,第二页链到第三页,蜘蛛只要进来就会一直往下走,直到没有下一页为止。如果一个栏目有几十页,就等于给蜘蛛开了几十个入口,而这些 URL 往往结构相似、内容差异很小。

另一个原因是分页 URL 常常带参数。?page=2 和 ?p=2、?page=2&sort=new 可能指向同一批内容,但系统把它们当成不同 URL,收录量就被放大了。

先判断:这些分页页有没有独立价值

不是所有分页页都要处理。判断标准可以看两点:用户会不会主动搜到它,以及它本身有没有独特信息。

  • 值得保留的:有搜索需求的分页,比如某类目第 3 页本身承接了长尾流量;或者页码页面带有独立的标题、描述和摘要内容。
  • 可以收敛的:纯粹为了浏览而存在的深页码,内容只是列表的重复排列,用户几乎不会搜到第 8 页、第 15 页。
  • 需要规范的:同一分页内容对应多个参数版本,这属于 URL 规范问题,不是收录多少的问题。

处理顺序:从发现路径到收录状态

  1. 先统一 URL 形式。确定分页只用一种参数写法,其他写法用 301 或 canonical 收敛,避免同一个页码存在多个地址。
  2. 再看内链是否无限递归。如果分页是“下一页”一路串到底,可以考虑只在前几页保留链接,深页码改成跳转或仅通过分页组件访问,减少蜘蛛的无谓抓取。
  3. 然后决定收录策略。要保留的页码页,给它独立的标题、描述和必要的摘要内容;要收敛的,用 noindex 让它留在站内可访问但不进索引,通常比直接屏蔽抓取更稳妥。
  4. 最后看抓取预算。如果分页 URL 占用了大量抓取配额,导致详情页更新变慢,就要优先压缩这部分。

几个容易做错的地方

一是把分页页全部 noindex,结果连有流量的页码页一起处理掉了。二是用 robots.txt 屏蔽分页,蜘蛛抓不到页面,却仍可能因为外链而保留 URL,反而更难收敛。三是把每一页都 canonical 到第一页,这会让页码页失去独立存在的意义,如果它们本身有搜索流量,这种做法要谨慎。

分页问题的本质是“发现路径太密”加“URL 形式不统一”。先把这两件事理清,收录数量通常会回到一个更合理的范围。

至于最终收录多少、多久生效,取决于站点整体质量和搜索引擎的判断,没有固定的时间表,也不适合用某个数字去承诺。