网站收录

列表页翻到第几页:分页 URL 的抓取与收录取舍

分页页面数量多、层级深,很容易成为抓取与收录之间的模糊地带。本文把内容型列表、聚合型列表和纯导航分页分开处理,说明各自的取舍顺序,并给出分页 URL 写法、加载更多的替代方案,以及上线前可以逐条核对的自查清单。

网站收录

列表页翻到第几页:分页 URL 的抓取与收录取舍

分页页面在很多站点里数量不小,一个频道翻到几十页很常见。它们既不是完全没用的页面,也不是每一页都值得进索引。处理分页的关键,是先分清它是内容入口还是纯导航,再决定放与收。

分页 URL 为什么容易被卡住

蜘蛛进入列表页后,通常先抓第一页,再顺着下一页链接往下走。走到第二页、第三页时,链接层级已经比较深,如果站点没有别的入口指向后面的页码,抓取很容易在这里停下。这不是蜘蛛不喜欢后面的页面,而是它判断继续深入的收益有限。

另一个常见情况是分页 URL 参数变化太多,比如同时存在 ?page=2、?p=2、?start=10 几种写法,指向同一批内容。蜘蛛面对重复的列表结构,往往只会保留其中一部分。

先给分页分类,再决定取舍

  • 内容型列表页:文章、商品、房源等逐条排布,每一页都包含独立条目。这类分页有实际价值,值得保留为可抓取、可索引。
  • 聚合型列表:标签、筛选、排序结果。内容大概率与主列表重复,通常不求收录,但要保证链接结构清晰,不至于把抓取预算耗光。
  • 纯导航分页:比如评论区翻页、图片集翻页。它们服务于阅读体验,收录与否影响不大,重点是别让它们互相之间形成死循环。

几种分页写法与对应处理

路径式(/list/page/2/)对搜索引擎最友好,URL 稳定、易读,也方便在 sitemap 里单独列出;参数式(?page=2)足够用,但要统一只保留一种参数,别让同一页有多个入口。

加载更多和无限滚动不生成新 URL,蜘蛛点不到后面的内容。常见做法是给每批内容配一个可访问的分页链接,点击时用脚本追加,同时把这个链接留成真实的 a 标签地址。

该收的收,该收口的收口

如果分页确实承载独立内容,可以保持可索引,并注意两点:一是标题别全都一样,至少在标题里体现页码或范围;二是第一页与第二页之间要有明确的前后链接,别只靠上一页按钮。

如果分页只是筛选排序的产物,可以不必强求收录,但要避免它们挤占抓取:用 robots.txt 屏蔽明显无意义的参数组合,或在页面上限制筛选维度,让 URL 组合数量可控。已经产生的重复分页,可考虑用 canonical 指回主列表,但前提是两者内容确实高度重合。

上线前可以自查的几点

  1. 任意一个列表页,从首页出发几次点击能到第 3 页?
  2. 同一批内容是否存在多种分页 URL 写法?
  3. 分页链接是否都是可点击的 a 标签,而不是纯 JS 事件?
  4. 评论、筛选等低价值分页是否被限制在可控数量内?
  5. 蜘蛛日志里,列表页的抓取是否集中在第一页?
分页不是越多越好,也不是越少越好。判断标准很简单:这一页拿掉之后,用户和蜘蛛是否还能找到后面的内容。