网站收录

分页列表页的收录取舍:第 2 页之后要不要放行

列表页翻页会随内容增长不断变多,几十上百页的分页容易挤占收录名额,而详情页反而排在后面。这篇文章把分页页分成导航、聚合和纯翻页三种角色,给出判断放行的问题清单、canonical 与 noindex 的处理顺序,以及几个常见坑,帮你在收录规模和内容发现之间找平衡。

网站收录

分页列表页的收录取舍:第 2 页之后要不要放行

分页是列表型站点最常见的结构:文章列表、商品列表、分类目录都会翻页。翻页本身没有问题,问题在于页数会随内容增长不断变多,几十页甚至上百页的分页很容易把收录名额占满,而真正能带来搜索流量的详情页反而排在后面。要不要让第二页之后进入索引,取决于这些分页页对用户和搜索是否真的有用。

先弄清分页页的三种角色

  • 导航路径:用户靠它逐页浏览,搜索引擎靠它发现更深层的内容。
  • 内容聚合:某些列表页的标题和摘要本身能回答“某类内容有哪些”这类问题。
  • 纯翻页工具:只是把同一批内容换个顺序,本身没有独立信息。

收录决策其实就是在判断某一页更接近哪一种角色。前两种可以留,第三种通常没必要占用索引名额。

判断是否放行的几个问题

  1. 这一页有独立的标题和描述吗,还是只有“第 3 页”这样的通用文案?
  2. 页面上有没有当前页独有的内容,比如不同的摘要、不同的排序结果?
  3. 搜索用户会不会直接搜到这一页,而不是搜到里面的某一条详情?
  4. 它是不是详情页的主要发现入口,去掉之后深层内容还进得来吗?

如果四个问题的答案都是否定的,这一页更接近纯翻页工具,收敛它一般不会损失什么。

常见处理方式的顺序

  1. 先保证分页链接是标准的 a 标签,能被正常抓取和跟随,不要只靠 JS 点击或按钮事件。
  2. 保留前几页参与索引,通常一到三页就够;更靠后的页面可以 noindex,或把 canonical 指向归一化后的地址。
  3. 如果分页实际是“加载更多”,加载的是同一批内容,考虑改成真正的翻页地址,而不是无限滚动。
  4. 每一页都放自指的 canonical,不要让所有分页都指向第一页。那样虽然能收敛索引,却会削弱翻页链接的发现作用。
  5. 收录策略调整后,观察一段时间再决定是否继续收紧,避免一次性改得太狠。

几个容易踩的坑

  • 对第二页之后直接 noindex,同时又指望它承担内链传递作用,这两件事本身是矛盾的。noindex 页面仍可能被抓取,但长期不利于内容发现。
  • 分页 URL 带排序、会话或时间参数,同一页出现多个版本,收录被稀释,排查时很难看清哪一版是主版本。
  • 把分页页成批塞进 sitemap,尤其是几百页那种,等于主动放大索引膨胀,还会挤占真正需要提交的地址。
  • 只在 robots.txt 里屏蔽分页,页面仍可能通过其他链接被收录,不如用 canonical 或 noindex 表达更明确的态度。

用什么数据来验证决定

调整前后都值得回看两组数据:一是分页页自身的曝光和点击,如果长期接近于零,就是可以被收敛的信号;二是深层详情页的抓取与收录数量有没有同步下滑,如果下滑明显,说明分页承担了发现入口的角色,需要保留至少前几页。两组数据一起看,比单看收录总量更可靠。

分页收录没有统一答案,它和站点的内容体量、更新频率、详情页的可发现性都有关系。与其一次设置完就不管,不如把它当成一个定期回看的开关:内容规模变了,策略也跟着调整。