列表页、目录页翻到第二页、第三页时产生的新 URL,常常在收录报告里占掉一大块。这些页面该不该进索引没有统一答案,要看它有没有独立用途、有没有人链过去、会不会和第一页抢同一批词。
分页 URL 的三种常见形态
- 路径式:/list/page/2/,结构清楚,容易被当成同一组页面。
- 参数式:/list?page=2,容易和排序、筛选参数混在一起,生成大量组合 URL。
- 点击加载:滚动到底自动加载,地址栏不变。蜘蛛通常看不到后续内容,需要额外的可抓取链接来补。
判断某一页要不要留在索引里
- 这一页上有多少内容是第一页没有的?只是同一批条目换个顺序,价值有限。
- 有没有内链指向它?如果只有分页导航一条路径,发现和更新都会慢。
- 搜索的人有没有可能直接落到这一页?长尾词偶尔会落在深分页上,但概率不高。
- 它的标题、描述、H1 是不是直接复用了第一页?大量重复的元数据会削弱它单独出现的机会。
几种处理方式的代价
全部放开抓取和索引
好处是结构简单,深层内容容易被发现;代价是索引里塞进大量近似页面,抓取预算被消耗在低价值 URL 上。
可抓取,但 noindex
不占索引位,蜘蛛仍能顺着链接往深处走。注意 noindex 不等于不抓取,页面还是会被访问,只是不进索引。如果第二页确实有独有内容,这样做会一并排除掉。
canonical 指向第一页
这是最常见的误用之一。分页并不是重复内容,把它指向第一页,等于声明这一页是第一页的副本,独有内容可能被一起送走,搜索引擎也有可能直接忽略这个信号。
robots.txt 屏蔽分页
一般不推荐。屏蔽之后连页面上的链接都看不到,第二页往后更难被发现,等于把一条通路堵死。
URL 上可以提前做的整理
- 分页参数保持一种写法,不要同时存在 ?page= 和 /page/。
- 排序、筛选参数尽量和分页分离,避免生成近乎无限的组合。
- 固定每页条数,别因为每页 20、50、100 再生成多套分页。
- 不要让分页带上不该有的跟踪参数,它只会制造更多重复 URL。
内链怎么写,蜘蛛才走得下去
第一页链接到第二页,第二页再到第三页,逐级递进;分页导航用普通 a 标签,别只做成按钮。若内容量确实大,可以给一个查看全部的入口,但同样要考虑它会不会和分页形成重复。
分页不一定要全部进索引,但最好都能被抓到。抓取是通路,索引是筛选,两件事分开处理会清晰很多。
上线后的检查清单
- 从第一页能否一步步点到最后一页。
- 深分页上有没有独有的商品、文章或标题。
- 分页是否误加了 canonical 或 noindex。
- 分页 URL 是否随筛选、排序组合爆炸。
- 收录报告里分页占比是否异常增长。
分页的收录处理没有一刀切的答案,核心是分清哪些页面承载了独有内容,哪些只是浏览路径。把这条路想清楚,索引里留下的东西会干净不少。