分页页面的问题不在“翻页”,而在内容信号
列表页翻到第 2、3 页,URL 变了,内容主体也变了,但模板结构、标题格式、正文区块几乎一样。对搜索引擎来说,这类页面处在“像重复页面”和“有独立内容”之间的模糊地带。处理不好,要么大量分页占掉索引名额,要么把本来能带来长尾流量的列表页挡在门外。
三种常见处理方式及各自代价
- 全部允许抓取和索引:分页能被搜索到,长尾列表项有机会直接带来流量。代价是索引里可能堆积大量近似页面,抓取预算被摊薄,质量评估也被拉低。
- noindex, follow:页面上的链接仍能被发现和跟踪,但页面本身不进索引。适合“更多结果”型分页,不适合每页都有独立商品或文章的列表。
- canonical 指向第 1 页:想让权重集中到第一页。但如果第 2 页确实有不同内容,这个信号可能被忽略;用户也无法从搜索直接落在第 2 页。
不要对同一个分页页同时用 noindex 和指向首页的 canonical,两套信号互相抵消,最后是哪个生效取决于搜索引擎的判断,你很难预期。
先判断第 2 页有没有独立检索价值
判断标准可以很直接:第 2 页上的条目,是否有用户会用不同的关键词搜到?如果列表项是商品、文章、房源这类有独立标题和详情页的内容,分页往往保留可索引更合适——用户搜到的其实是分页里的某个条目,点进去之后才到详情页。反过来,如果翻页只是同一批结果的不同排序或“查看更多”,页面本身没有独立信息,那么把它排除索引通常更干净。
还要看分页是否带来过自然流量。在流量报表里按落地页筛出 /page/2/ 这类 URL,有稳定点击就说明有保留价值;长期零点击、又频繁被抓取,就可以考虑收缩。
URL 与规范化要一致
- 同一套分页只保留一种 URL 写法。不要既有带 page=2 参数的版本,又有 /page/2/ 的路径版本,两者都会被蜘蛛抓到,形成重复。
- 分页页的 canonical 一般自引用,指向自己,而不是第一页。
- 如果确认要排除索引,用 noindex, follow 即可,不必再把 canonical 指向首页。
- 分页之间的链接要真实可爬,从第 1 页能顺着点到第 2、3 页,不要只靠按钮或 JS 事件。
无限滚动和“加载更多”要额外注意
如果列表只靠 JS 追加内容,URL 始终不变,那么第 2 页之后的内容其实都挂在同一个 URL 下。蜘蛛看不到新 URL,也就谈不上单独收录;如果渲染不完整,还可能只抓到首屏。更稳的做法是保留可点击的分页链接,让每一批结果有独立 URL,再按上面的思路决定哪一批该进索引。
抓取、索引、排名是三件不同的事
允许抓取不等于会被索引,被索引也不等于会有排名。分页页即使被抓取,也可能因为内容近似而只保留其中一两个版本;即使被索引,没有搜索需求也不会有展示。所以调整分页策略后,可以用站点查询看分页的收录量,用服务器日志看蜘蛛是否还在反复抓取,再对照流量变化,判断这次调整是让索引更干净了,还是误伤了有流量的页面。
回到开头的问题:分页该不该收录,取决于第 2 页之后有没有独立的检索价值。有,就保持自引用规范化并让它可抓可索引;没有,就用 noindex, follow 排除索引,同时保证站内链接链完整。不要一边 noindex 一边 canonical 指向别处,也不要在同一套分页里留下多种 URL 写法。