网站收录

分页页面的收录处理:第 2 页之后要不要留给索引

列表页翻页产生的 URL 常是收录报告里的大户。本文说明路径式、参数式、点击加载三种分页形态的差异,给出判断某一页是否值得进索引的几个问题,并对比放开索引、noindex、canonical 指向第一页、robots.txt 屏蔽各自的代价,最后整理 URL 与内链上可以提前做的事。

网站收录

分页页面的收录处理:第 2 页之后要不要留给索引

列表页、目录页翻到第二页、第三页时产生的新 URL,常常在收录报告里占掉一大块。这些页面该不该进索引没有统一答案,要看它有没有独立用途、有没有人链过去、会不会和第一页抢同一批词。

分页 URL 的三种常见形态

  • 路径式:/list/page/2/,结构清楚,容易被当成同一组页面。
  • 参数式:/list?page=2,容易和排序、筛选参数混在一起,生成大量组合 URL。
  • 点击加载:滚动到底自动加载,地址栏不变。蜘蛛通常看不到后续内容,需要额外的可抓取链接来补。

判断某一页要不要留在索引里

  1. 这一页上有多少内容是第一页没有的?只是同一批条目换个顺序,价值有限。
  2. 有没有内链指向它?如果只有分页导航一条路径,发现和更新都会慢。
  3. 搜索的人有没有可能直接落到这一页?长尾词偶尔会落在深分页上,但概率不高。
  4. 它的标题、描述、H1 是不是直接复用了第一页?大量重复的元数据会削弱它单独出现的机会。

几种处理方式的代价

全部放开抓取和索引

好处是结构简单,深层内容容易被发现;代价是索引里塞进大量近似页面,抓取预算被消耗在低价值 URL 上。

可抓取,但 noindex

不占索引位,蜘蛛仍能顺着链接往深处走。注意 noindex 不等于不抓取,页面还是会被访问,只是不进索引。如果第二页确实有独有内容,这样做会一并排除掉。

canonical 指向第一页

这是最常见的误用之一。分页并不是重复内容,把它指向第一页,等于声明这一页是第一页的副本,独有内容可能被一起送走,搜索引擎也有可能直接忽略这个信号。

robots.txt 屏蔽分页

一般不推荐。屏蔽之后连页面上的链接都看不到,第二页往后更难被发现,等于把一条通路堵死。

URL 上可以提前做的整理

  • 分页参数保持一种写法,不要同时存在 ?page= 和 /page/。
  • 排序、筛选参数尽量和分页分离,避免生成近乎无限的组合。
  • 固定每页条数,别因为每页 20、50、100 再生成多套分页。
  • 不要让分页带上不该有的跟踪参数,它只会制造更多重复 URL。

内链怎么写,蜘蛛才走得下去

第一页链接到第二页,第二页再到第三页,逐级递进;分页导航用普通 a 标签,别只做成按钮。若内容量确实大,可以给一个查看全部的入口,但同样要考虑它会不会和分页形成重复。

分页不一定要全部进索引,但最好都能被抓到。抓取是通路,索引是筛选,两件事分开处理会清晰很多。

上线后的检查清单

  • 从第一页能否一步步点到最后一页。
  • 深分页上有没有独有的商品、文章或标题。
  • 分页是否误加了 canonical 或 noindex。
  • 分页 URL 是否随筛选、排序组合爆炸。
  • 收录报告里分页占比是否异常增长。

分页的收录处理没有一刀切的答案,核心是分清哪些页面承载了独有内容,哪些只是浏览路径。把这条路想清楚,索引里留下的东西会干净不少。