网站收录

分页与列表页的收录取舍:第二页之后还值不值得被索引

列表页和分页往往只有排序差异,却常常要么整站被抓一遍,要么第二页之后再无踪影。这篇文章从地址形态、内容差异和抓取成本出发,讨论哪些分页值得保留收录、哪些适合用 canonical 或 noindex 收敛,并给出一份可以直接照着做的自查清单。

网站收录

分页与列表页的收录取舍:第二页之后还值不值得被索引

列表页和分页几乎是每个内容站、电商站都会有的页面形态,但它们在收录问题里常常被当成附属品——要么整站都被抓了一遍,要么第二页之后永远进不了索引。这两种结果其实都不算理想,关键是想清楚一件事:这一页对搜索者有没有独立价值。

分页为什么会变成一堆近似页面

分页往往只有排序位置不同,标题、描述、摘要模板高度一致。蜘蛛顺着链接逐条抓下来,很容易把整串地址判定为高度重复的序列,于是从中挑一两个作为代表,其余的不索引,或者索引了也很少获得流量。

更麻烦的是抓取成本。一个几百页的列表,如果每页都完整展开,就会占掉相当一部分抓取次数,而这些次数本可以留给真正的内容页。

先看分页的地址长什么样

  • 路径式:形如 /list/page/2/ 的静态路径,对蜘蛛最友好,也最容易单独控制。
  • 参数式:?page=2 这类写法本身没问题,但参数一多,同一页容易衍生出多种地址,需要先统一。
  • 无限滚动:地址栏不变,内容靠脚本追加,蜘蛛通常只能看到第一屏,后面的内容等于不存在。

如果确实希望滚动列表被收录,常见做法是同时保留一套可访问的分页地址,让滚动只作为浏览体验层。

哪些分页值得保留

判断标准可以简化成一句:这一页上有没有别处没有的东西。

  • 商品列表、文章归档:第二页之后往往仍包含独占的条目,用户也确实会往后翻,保留收录通常有意义。
  • 带筛选维度的列表:只有当这个组合本身存在搜索需求时才考虑放开,否则容易批量生成低价值组合页。
  • 纯导航型分页:每页只有几条摘要,点进去还是同一批内容,索引价值很低。

几种常见的收敛手段

canonical 与 noindex 的分工

如果分页内容与主列表高度重叠,可以把第二页之后 canonical 指向第一页;如果希望页面仍能正常访问但不进入索引,用 noindex 更直接。两者不要在同一组页面上互相矛盾地叠加,否则蜘蛛只能自行猜测。

rel=next 与 rel=prev 已不再是收录信号

这套标签如今更多只是提示,不要指望靠它解决重复问题,真正起作用的仍然是内容差异和 canonical 的一致性。

参数规范化

排序参数、来源追踪参数、会话参数混进分页地址,会让蜘蛛把同一页当成几十个不同地址。先固定一套书写方式,再来谈收录处理。

一份可执行的自查清单

  1. 手动打开第二页、第三页,看标题和摘要是不是几乎相同。
  2. 在服务器日志里数一下,分页地址占了多少抓取次数。
  3. 确认分页地址没有混入排序、筛选、来源等无关参数。
  4. 检查无限滚动是否配有可抓取的分页地址。
  5. 明确哪些分页放开、哪些收敛,写成规则,而不是逐页临时决定。
分页处理的目标不是让每一页都进索引,而是让索引里的页面各有各的用途。收录数量本身不是成绩。

最后提醒一点:分页策略调整之后,索引层面的变化通常滞后数周。观察效果时最好把日志里的抓取频次和索引报告放在一起看,避免因为短期波动就反复改动规则。