网站收录

分页列表第 2 页之后:放出来收录还是收起来

分页列表的第 2 页之后要不要放开收录,取决于它有没有独立信息、详情页有没有其他发现路径。本文梳理三种常见处理方式各自的代价,以及放开或收起后需要确认的 URL 形式、canonical、noindex 配合和结果验证方法。

网站收录

分页列表第 2 页之后:放出来收录还是收起来

列表页翻页是站内很常见的结构:一页 20 条,翻到第 5 页、第 20 页。这些页面要不要让搜索蜘蛛抓、要不要留在索引里,很多站长其实是靠默认设置决定的——分页链接照常输出,也没做任何处理。等到发现收录量虚高、或者列表页把详情页的位置挤掉,才开始回头收拾。

先想清楚分页页承担什么

分页页的本质是把一组同主题内容切开展示,它本身很少是用户搜索的终点。用户搜的是某一条具体内容,或者某一类内容的入口,而不是“第 7 页”。这说明大多数分页页的索引价值偏低,但低价值不等于零价值,判断要落到具体站点类型上。

  • 电商分类页:翻页后仍是同类商品,第 2 页之后彼此重复度高,独立信息有限。
  • 文章列表或归档页:如果按时间、标签聚合,翻页往往只是同一批 URL 的不同排列。
  • 站内搜索结果页、筛选结果页:通常不建议放开,容易生成大量近似 URL,也难有稳定标题。

常见的三种处理方式

一、全部放开,用 canonical 指向第一页

做法最简单,代价是把抓取预算花在重复度很高的页面上;而且 canonical 属于建议信号,最终归并结果不一定完全符合预期,需要观察后再调。

二、放开前几页,后面的用 noindex 或不再输出链接

比较折中的思路,通常保留第 1 页可索引,第 2 到第 3 页视内容情况处理,更靠后的翻页页收起来。

三、整组收起来,只让第 1 页进入索引

适合内容高度同质、翻页只是排序变化的场景。前提是详情页还有别的发现路径,不会因此变得孤立。

做决定前要确认的几件事

  • 详情页是否只靠列表页翻页被发现?如果是,砍掉分页链接可能让一部分深层 URL 失去入口。
  • 分页 URL 的形式是否统一?page=2、/page/2/、p=2 加排序参数混用,会把同一批内容拆成多套地址。
  • 每页条数是否稳定?条数改来改去,会让同一条内容在不同 URL 之间来回挪动,索引也跟着反复。
  • 有没有 XML 站点地图覆盖详情页?有的话,分页页承担的主要是用户浏览,而不是发现。

如果决定放开,顺手做这几步

  1. 分页 URL 固定一种形式,参数顺序、大小写、末尾斜杠都统一。
  2. 给分页页写能区分的标题,至少不要和第一页完全相同,描述也不要照抄。
  3. 第 1 页 canonical 指向自己,理清自指关系;不要一边把所有分页都指向第一页,一边又指望它们各自被独立索引。
  4. 详情页数量大时,把站点地图和内链这条更稳的发现路径补齐,别让发现全靠翻页。

如果决定收起来

收起有两种方式,效果差别不小。用 noindex 是允许抓取但不索引,页面仍会消耗一部分抓取资源;直接不在 HTML 里输出分页链接,则连发现路径一起断开,需要确认底部导航、站点地图或“查看更多”能补上入口。

不要一边用 robots.txt 屏蔽分页目录,一边又指望 noindex 生效——被 robots.txt 挡住的页面,搜索蜘蛛看不到页面里的 noindex,标签也就无从执行。

改完怎么看结果

调整之后至少观察两到四周。可以看日志里分页 URL 的抓取频次是否下降、详情页的抓取是否上升;再看索引中分页页面的数量变化,以及这些页面的展现和点击是否转移到了第 1 页或详情页。如果分页抓取下来了,详情页抓取却也没上来,多半说明发现路径被切断,需要把内链或站点地图补回来。

分页收录没有统一答案,判断标准其实很朴素:这个页面有没有独立于第一页的信息,用户有没有可能直接落在它上面。答案是否定的,收起来通常更省事;答案不确定的,先放开一小段,用日志和索引状态看两三周,再决定去留。