站点运营

站点运营:分页与翻页自查,别让列表页挡住新内容的路

列表页的翻页链接是站内新内容被发现的重要通道之一。本文梳理分页常见的几类问题,包括翻页依赖脚本、路径与参数混用、规则误屏蔽、翻页层级过深等,并给出一份可以直接照着做的自查清单,帮助你把栏目页、归档页的翻页结构整理清楚,让老内容也有被重新访问的机会。

站点运营

站点运营:分页与翻页自查,别让列表页挡住新内容的路

栏目页、标签页、归档页是站内新内容被发现的主要入口。这些页面通常靠翻页把历史内容一页页铺开,如果分页这一环出了问题,蜘蛛往往只抓到第一页的十几条链接,后面的内容就只能靠 Sitemap 和内链碰运气。

分页为什么会影响 URL 发现

蜘蛛的抓取是有预算的。它进入一个列表页后,会沿着页面上的链接继续走。分页链接如果存在且可点,它就能顺着翻到第二页、第三页;如果分页链接是按钮、是脚本生成、是异步加载出来的,那么对蜘蛛来说,这一页就是终点。时间一长,越老的内容越难被重新访问,更新过的旧文章也可能长期停留在旧版本上。

常见的几类分页问题

翻页链接依赖脚本

“加载更多”按钮通过点击事件请求接口并把结果插入页面,这种写法对用户很顺手,但链接没有出现在初始 HTML 里。可以给按钮加一个普通的 a 标签作为回退,指向带页码的地址,让不支持脚本的访问者也能翻页。

路径与参数混用

同一个列表既能用 /list/page/2/ 访问,也能用 /list/?p=2 访问,两套地址各自被抓,就容易出现重复内容。挑一种作为标准,另一种用 301 指过去,或者干脆不产生。

分页被规则挡住

有些人担心翻页太多浪费抓取,就在 robots.txt 里屏蔽带 page 的地址,或者给分页加上 noindex。屏蔽之后,蜘蛛同样无法沿着这些链接往下走,代价是新内容发现变慢。如果只是不想让分页参与排名,用 noindex,follow 更合适,同时确认 canonical 指向自身而不是第一页。

翻页数量过多

一个栏目如果分成上百页,后面几十页可能长期无人访问。可以考虑限制可见翻页范围,同时用 Sitemap 或专题页把老内容重新组织成可发现的入口。

自查清单

  1. 打开栏目页的源代码,确认翻页链接是 a 标签,且 href 里有真实地址。
  2. 用禁用脚本的方式看一眼页面,是否还能走到第二页。
  3. 检查分页地址是否只有一种形式,尾斜杠、大小写、参数顺序是否统一。
  4. 查看分页页面的 canonical,是否指向自身,而不是全部指向第一页。
  5. 确认分页的 meta robots 没有误用 noindex,nofollow。
  6. 翻到最后一页,看是否存在空白页、重复的第一页内容或 404。
  7. 排序参数(按时间、按热度)是否产生了大量内容相同的地址。
  8. 在访问日志里搜一下翻页地址的抓取记录,看蜘蛛实际走到了第几页。

处理时的几个原则

  • 优先保证可达:先让链接能被抓到,再谈要不要让它参与排名。
  • 一个地址一种形式:分页地址越规整,重复内容的排查成本越低。
  • 给老内容留入口:除了翻页,也可以用分类聚合、相关推荐、Sitemap 分担发现任务。
  • 改动后回看日志:调整了分页结构,隔一段时间看看蜘蛛的抓取路径有没有跟着变化。
分页不是靠堆页码来讨好蜘蛛,而是把已有的内容组织成一条能被走通的路。

这类检查不需要多复杂的工具,打开页面看源码、亲手翻几页、再翻翻访问日志,多数问题就能暴露出来。发现一处改一处,比一次性大改模板更稳妥。