网站收录

分页列表页的收录取舍:哪些页码保留,哪些可以收敛

分页列表页翻出的每一页都是独立 URL,容易占用抓取、堆积近重复内容。本文区分带独立内容的分页、纯导航翻页与深页码,给出保留前几页、用 noindex 收敛深页码、补齐详情页入口的处理顺序,并说明为什么不建议把分页 canonical 全部指向第一页。

网站收录

分页列表页的收录取舍:哪些页码保留,哪些可以收敛

分页页面本质上是同一批内容的多次切片

分类列表、文章归档、商品列表,翻页后生成的每一页都是独立 URL。对爬虫来说,?page=2 和列表第一页是两个不同的地址,不会被自动合并。一个 20 页的分类,就等于给站点多加了 19 个页面;分类一多,这类 URL 很容易堆到几千条。它们会消耗抓取配额,也可能进入索引,最后表现为索引里一堆标题相似、内容大多是同几篇文章摘要的页面。

先分清三类分页,再决定怎么处理

1. 带独立内容的分页

比如按价格、销量排序的列表,或每页有独立摘要、独立筛选维度的页面。这类页面可能有自己的搜索需求,可以考虑保留索引,但要注意排序参数不要无限组合。

2. 纯导航性质的翻页

第二页到最后一页,主要作用是让用户和爬虫继续往下走。它们几乎没有独立搜索价值,也不值得长期留在索引里。

3. 深页码

翻到十几页之后,通常已经是旧内容或长尾条目。用户很少进入,爬虫也不该反复来。

推荐的收敛顺序

  1. 前几页保留可索引。第一页保留索引是常识;如果第二、三页有真实点击和转化,也可以保留。
  2. 深页码用 noindex 处理,而不是 robots.txt。robots.txt 屏蔽之后爬虫不再抓取这些 URL,页面上指向详情页的链接也就看不到了,等于自己切断了发现路径。noindex 只是不进索引,链接仍有机会被跟踪。
  3. 把详情页的入口搬到稳定位置。更可靠的做法是让详情页出现在分类第一页、站点地图和相关推荐模块里,不依赖深页码传递链接。
  4. 无限滚动要留一条可抓取的路径。纯 JS 加载的列表,如果没有任何分页 URL,首屏之外的条目对爬虫等于不存在。
需要留意的是:把所有分页的 canonical 都指向第一页,并不是通用解法。规范标签表达的是“这是同一页面的不同版本”,而第三页并不是第一页的副本,指向第一页可能让整组分页的抓取都停下来。

如何判断处理得对不对

过一两周,用站点查询看分页 URL 的索引数量有没有下降;同时去看抓取统计,确认深页码的抓取次数明显减少,而详情页的抓取没有被顺带砍掉。关键指标不是分页被收录多少,而是详情页是否照常被抓取和收录。如果分页收敛后详情页收录反而变慢,说明发现路径依赖得太深,需要补内链或站点地图。

两个容易忽略的细节

  • 分页 URL 形式保持统一。同一组列表同时存在 ?page=2、/page/2/、?paged=2 三种写法,只会让问题翻倍。
  • 排序、筛选参数如果可任意组合,先限制组合数量,再谈收不收录。参数组合生成的是成百上千个近重复页面,靠 noindex 一条条堵会很累。

分页的处理目标不是“让更多页面被收录”,而是让爬虫把有限的抓取用在真正需要索引的详情页上。分页本身只是通道,通道不需要全部进索引。