站点运营

站点运营:分页与无限滚动自查,别让蜘蛛只看到第一页

栏目内容变多之后,分页就成了蜘蛛进入深层内容的通道。本文梳理数字分页、上一页下一页、加载更多与无限滚动这几种常见形态,并给出一份可执行的自查清单,涵盖链接可抓取性、页码 URL 规则、分页页面的 canonical 处理,以及无限滚动如何补上静态入口。

站点运营

站点运营:分页与无限滚动自查,别让蜘蛛只看到第一页

栏目写到一定数量,列表就必然要分页。用户看到的是翻页按钮,搜索蜘蛛看到的是通往深层内容的入口。如果分页处理得随意,蜘蛛往往在第一页就停下,后面几十页的内容再用心,也可能长期缺少被发现的路径。

分页服务两个不同的读者

用户关心的是浏览体验:翻到第几页、能不能快速回到开头、加载会不会卡住。蜘蛛关心的是链路是否完整:从列表页能不能走到第 2 页、第 3 页,页码 URL 是否稳定,返回的页面是不是真的换了内容。两者的需求有重叠,但优先级并不一样,很多分页问题正是为了迁就一方而牺牲了另一方。

用户视角的连续性

页码要清晰,当前位置要有提示,翻页后的滚动位置合理,从详情页返回列表时最好还能停在原来的位置。这些体验细节不直接决定抓取,但会影响用户是否愿意往深处点,间接影响页面的真实使用情况。

蜘蛛视角的可达性

分页链接最好写在标准 a 标签的 href 里,而不是靠点击事件在浏览器里临时拼接。如果翻页完全依赖脚本,蜘蛛可能拿不到下一页地址。另外,每一页返回的正文应当不同,否则容易被当成重复页面处理。

常见的三种分页形态

  • 数字分页:第 1、2、3 页并列,链路清晰,但页数一多就容易形成大量浅层链接,需要控制每屏展示的页码数量。
  • 上一页/下一页:结构简单,路径是一条线,适合按时间顺序排列的栏目。问题在于只能一步步走,中间页缺少横向入口。
  • 加载更多与无限滚动:体验流畅,但页面 HTML 里往往只有第一批内容,后续数据靠接口返回,蜘蛛不执行脚本就看不到。

分页自查清单

  1. 打开栏目第一页,查看源码中是否存在指向第 2 页的可点击链接。
  2. 用纯文本方式或关闭脚本访问第一页,确认还能不能走到第二页。
  3. 检查页码 URL 是否稳定,避免同一页出现多种参数写法。
  4. 确认每一页的标题和描述有区分,至少不要全部一模一样。
  5. 检查分页页面的 canonical,通常指向自身更合适,不要全部指向第一页。
  6. 查看分页链接是否被 robots 规则、nofollow 或脚本误挡,导致链路中途断开。
  7. 确认总页数不会无限增长,归档类栏目尤其要留意。
  8. 抽查第 3 页、第 10 页的返回状态码,确认不是 404,也没有跳回首页。

无限滚动需要补上静态入口

如果栏目采用无限滚动,建议同时保留一条可被抓取的路径,常见做法有几种:

  • 在页面底部给出分页链接,作为兜底入口。
  • 提供按时间或分类归档的列表页,把内容按月份或标签汇总。
  • 在站点地图中列出主要的列表页地址,让深层内容多几个入口。
  • 对加载更多按钮使用真实的链接地址,脚本只负责拦截点击,不负责生成地址。

分页 URL 的几个细节

页码参数尽量简单,例如固定使用 page 一个参数,不要混用 p、pg、start 等多种写法。排序参数、筛选参数如果和分页叠加,容易产生大量组合地址,这类页面更适合用 robots 规则或 nofollow 控制,而不是让它们全部进入抓取队列。

还要注意分页与终端的关系:部分站点在手机上用加载更多,在桌面端用数字分页,两个版本的链接结构最好保持一致,避免蜘蛛只在其中一个版本里能找到深层入口。

分页不是内容本身,而是通往内容的桥。桥断了,内容再扎实也走不进去。

小结

分页自查不需要复杂工具,打开源码看链接、关掉脚本看链路、抽查几页看状态码,基本就能发现大部分问题。把分页当成站点结构的一部分来规划,蜘蛛的抓取路径会顺畅一些,用户翻找旧内容时也少几分阻碍。