列表页和分页几乎是每个内容站、电商站都会有的页面形态,但它们在收录问题里常常被当成附属品——要么整站都被抓了一遍,要么第二页之后永远进不了索引。这两种结果其实都不算理想,关键是想清楚一件事:这一页对搜索者有没有独立价值。
分页为什么会变成一堆近似页面
分页往往只有排序位置不同,标题、描述、摘要模板高度一致。蜘蛛顺着链接逐条抓下来,很容易把整串地址判定为高度重复的序列,于是从中挑一两个作为代表,其余的不索引,或者索引了也很少获得流量。
更麻烦的是抓取成本。一个几百页的列表,如果每页都完整展开,就会占掉相当一部分抓取次数,而这些次数本可以留给真正的内容页。
先看分页的地址长什么样
- 路径式:形如 /list/page/2/ 的静态路径,对蜘蛛最友好,也最容易单独控制。
- 参数式:?page=2 这类写法本身没问题,但参数一多,同一页容易衍生出多种地址,需要先统一。
- 无限滚动:地址栏不变,内容靠脚本追加,蜘蛛通常只能看到第一屏,后面的内容等于不存在。
如果确实希望滚动列表被收录,常见做法是同时保留一套可访问的分页地址,让滚动只作为浏览体验层。
哪些分页值得保留
判断标准可以简化成一句:这一页上有没有别处没有的东西。
- 商品列表、文章归档:第二页之后往往仍包含独占的条目,用户也确实会往后翻,保留收录通常有意义。
- 带筛选维度的列表:只有当这个组合本身存在搜索需求时才考虑放开,否则容易批量生成低价值组合页。
- 纯导航型分页:每页只有几条摘要,点进去还是同一批内容,索引价值很低。
几种常见的收敛手段
canonical 与 noindex 的分工
如果分页内容与主列表高度重叠,可以把第二页之后 canonical 指向第一页;如果希望页面仍能正常访问但不进入索引,用 noindex 更直接。两者不要在同一组页面上互相矛盾地叠加,否则蜘蛛只能自行猜测。
rel=next 与 rel=prev 已不再是收录信号
这套标签如今更多只是提示,不要指望靠它解决重复问题,真正起作用的仍然是内容差异和 canonical 的一致性。
参数规范化
排序参数、来源追踪参数、会话参数混进分页地址,会让蜘蛛把同一页当成几十个不同地址。先固定一套书写方式,再来谈收录处理。
一份可执行的自查清单
- 手动打开第二页、第三页,看标题和摘要是不是几乎相同。
- 在服务器日志里数一下,分页地址占了多少抓取次数。
- 确认分页地址没有混入排序、筛选、来源等无关参数。
- 检查无限滚动是否配有可抓取的分页地址。
- 明确哪些分页放开、哪些收敛,写成规则,而不是逐页临时决定。
分页处理的目标不是让每一页都进索引,而是让索引里的页面各有各的用途。收录数量本身不是成绩。
最后提醒一点:分页策略调整之后,索引层面的变化通常滞后数周。观察效果时最好把日志里的抓取频次和索引报告放在一起看,避免因为短期波动就反复改动规则。