分页列表页是站点里数量最多、也最容易被误解的一类 URL。蜘蛛确实会顺着“下一页”一路抓下去,但被抓到只代表“发现”,不代表这一页适合进入索引。判断分页该不该收录,核心问题只有一个:用户有没有可能带着这一页独有的内容去搜索。
分页常见的三个问题
- 近似重复:第 2 页和第 1 页的正文结构、模板、侧栏几乎一样,只是内容块顺序不同。
- 标题雷同:所有分页共用同一个 title 和 description,索引里分不出主次。
- 无上限翻页:page 参数可以一直加,翻到后面常常是空列表或只有几条结果。
哪些分页值得单独收录
- 有独立搜索需求的:比如长期存在的“最新上架”列表,用户会直接搜这个列表,而不是搜某个具体商品。
- 不同排序维度带来明显不同结果的:按价格、按销量排序后前几屏差异较大,并且这些页面有自己的站内入口。
- 每页的挑选逻辑有区分度,而不是简单把同一批内容错位展示一遍。
反过来,翻到第 20 页之后、内容稀薄、几乎没有站内外入口的分页,通常不值得占用索引位置。
推荐的收口顺序
- 先确认现状:从日志和索引状态报告看分页被抓了多少、被收录了多少、有多少停在“已发现–尚未抓取”。
- 决定保留还是收口:如果主体内容与第一页基本一致,可以在分页上放 canonical 指向列表第一页;如果只是想保留链接发现能力、不想让它进索引,用 noindex,follow。两者不要叠在一起用,否则信号互相矛盾。
- 不要用 robots.txt 屏蔽分页:分页往往是通往详情页的重要路径,一旦屏蔽,蜘蛛顺着断掉的链路就停下了,反而拖慢详情页的发现。
- 给翻页设上限:超过一定页数后改用分类、时间区间或筛选条件切分,避免大量低价值 URL 无限增长。
- sitemap 只放想被索引的 URL:不打算收录的分页不必写进去,减少“已发现未收录”的堆积,也让收录率的统计更接近真实。
- 回看效果:调整后观察索引状态报告里分页的归类是否稳定,以及详情页的抓取量有没有变化。
canonical、noindex、robots.txt 是三种不同层级的工具:robots.txt 管抓取,noindex 管索引,canonical 管“选哪个当代表”。用错层级,常见的结果是页面既没被收录,链接也没被传递出去。
一个简单的判断准则
每增加一个分页 URL,问一句:用户会不会拿它单独去搜?如果不会,那它更适合留在“可抓取但不必收录”的状态,专心承担把蜘蛛和链接权重引向详情页的角色。收录数量不是越多越好,索引里堆满近似重复的翻页,反而会稀释整站的页面质量信号。