网站收录

分页与无限滚动的收录取舍:序列页该留,参数页该收

分页和无限滚动页面常出现两种极端:内容序列页被判重复而掉出索引,筛选参数页却被大量收录。本文按页面类型给出收录取舍思路,并说明标题差异化、canonical 自指、sitemap 与内链入口的具体做法。

网站收录

分页与无限滚动的收录取舍:序列页该留,参数页该收

分页和无限滚动是收录问题的高发区:要么第 2、3 页长期停在“已发现但未抓取”,要么排序、筛选参数被大量收录,反过来稀释了真正想进索引的页面。动手处理之前,先把这些页面按类型分清楚,再决定放行还是收敛。

一、先给分页分类

  • 内容序列页:列表按时间或热度切成第 1、2、3 页,每页条目不同,用户会真的往下翻。
  • 导航切分:只是为了避免单页过长而切分,第 2 页之后没有独立信息量。
  • 参数型分页:排序、视图、每页条数、会话追踪等参数混在其中。
  • 展示型滚动:前端无限滚动或“加载更多”,地址栏不变,或者地址变化不可控。

二、内容序列页通常值得被收录

这类页面本身承载不同的条目集合,用户搜索某条内容时可能直接落在第 3 页。放行的前提是把它当成独立页面来运营,而不是第一页的附属品。

  • 每页给出差异化的标题与描述,不要所有页码共用同一套文案。
  • canonical 自指,指向当前这一页的地址。
  • 不要把第 2 页 canonical 到第 1 页,那等于告诉引擎“这里没有独立价值”。
  • 不要用 noindex 一刀切,否则整条序列都会退出索引。
  • 序列特别长时,可以只保留前若干页作为可索引范围,后面的逐步收敛。

三、这几种分页可以收敛

  • 排序与视图参数,例如 sort、view、layout 之类。
  • 会话 ID、来源追踪等对内容没有影响的参数。
  • 每页条数切换产生的重复组合。
  • 纯导航切分、第 2 页之后内容与第一页高度重合的页面。

收敛手段要分清楚:想让它不被抓取,用 robots;想让它被抓取但不进索引,用页面上的 noindex;想让信号统一,用 canonical 或内链控制。三者混用往往出现“明明屏蔽了却还在索引里”的情况。

禁止抓取不等于禁止索引。一个被 robots 挡住的 URL 仍可能因为外链被收录成一条没有摘要的结果。

四、无限滚动与“加载更多”

核心问题只有一个:这些内容有没有稳定、可被抓取的地址。如果所有条目只靠一次滚动加载,而 HTML 里只有首屏内容,那么首屏之外的部分很难被发现。

  • 给分页一个真实地址,例如 page=2,滚动或点击时同步更新地址栏。
  • 在 sitemap 中列出重要的序列页,给它们一条不依赖翻页的发现路径。
  • 首屏 HTML 里保留可点击的分页链接作为兜底入口。
  • 如果内容靠 JS 渲染,检查渲染完成后的 DOM 里是否真的存在这些链接和文本。

五、入口比数量更重要

分页最常见的发现路径是“上一页”链接,这会导致第 5 页之后很久才被爬到一次。可以在分类页提供页码跳转或“查看全部”入口,也可以直接在 sitemap 中给出关键序列页,把发现路径缩短。收录效率的差别,很多时候不在页面数量,而在入口深度。

六、怎么验证处理是否有效

  1. 看抓取日志里分页 URL 的抓取频次与状态码,确认是否被大量重复抓取。
  2. 抽查渲染后的 canonical 与 meta robots,确认输出的是你预期的值。
  3. 在索引状态列表里核对被排除的原因:重复、已抓取未编入索引、被 noindex 分别对应不同处理。
  4. 比对 sitemap 与实际内链是否一致,避免一边提交一边被自己屏蔽。

最后提醒一句:让分页被收录不是目标,让用户和搜索引擎顺利抵达目录深处的有效内容才是。分页本身不产生价值,入口才产生价值。