站点运营

站点运营:分页与列表页自查,别让翻页变成蜘蛛绕着走的走廊

列表页和翻页链接常被忽略,却同时影响访客浏览和 URL 发现。本文梳理几种常见的分页写法带来的问题,给出一份可照着做的自查清单,并说明在 rel=next/prev 失效之后,如何用 canonical、边界设置和列表排序,让分页保持干净、有限、路径明确。

站点运营

站点运营:分页与列表页自查,别让翻页变成蜘蛛绕着走的走廊

列表页和分页是很多站点流量结构里被忽略的一块。首页、栏目页、文章页往往有人盯着,而第 3 页、第 8 页的翻页链接,常常是建站时随手生成、之后几年没人再看的地方。蜘蛛顺着这些链接走,访客也顺着这些链接翻,两边都在这条路上花时间。

分页为什么容易出问题

分页天然带着“重复”和“无限”两个属性。同一个栏目下的内容,会被首页、第 2 页、标签页、归档页反复列出;而只要不设边界,翻页链接可以一直往下生成。对访客来说,翻到第 20 页已经很难找到东西;对蜘蛛来说,那是一串内容相似、价值递减的地址。

几种常见的分页写法,各有各的麻烦

  • 全量展开式:列表页一次性输出几百条链接,页面体积大,链接权重被摊薄,新内容淹没在旧内容里。
  • ?page=1 与栏目首页并存:两个地址展示完全相同的列表,没有 canonical 或跳转区分,容易被当成重复页面。
  • 无限滚动:访客体验不错,但后续内容靠脚本加载,如果链接没有落到 HTML 里,蜘蛛往往只看到第一屏。
  • 翻页链接用相对路径或脚本跳转:路径层级算错,或者必须点击才能触发,抓取路径就断了。
  • 空结果页也返回 200:翻到超出范围时返回一个空白列表页,蜘蛛会继续往里走。

一份可以照着做的自查清单

  1. 打开栏目第一页,查看源码里翻页链接是不是标准的 <a href>,路径是否为绝对地址。
  2. 确认第 1 页与栏目首页的关系:保留一个规范地址,另一个用 301 或 canonical 指向它。
  3. 给分页设置上限。内容量不大的栏目,翻到一定页数后返回 404,或干脆不输出下一页链接。
  4. 检查每页输出多少条。常见的 10 到 30 条比较稳妥,具体看页面体积和栏目更新频率。
  5. 列表页上的标题、摘要最好和文章页保持区别,不要整段复制正文开头。
  6. 翻页地址里不要叠加跟踪参数,否则每翻一页都会生成一批新地址。
  7. 如果用了无限滚动,确认后续内容有可被抓取的链接入口,比如“查看全部”的分页版本。
  8. 在日志里看蜘蛛对分页地址的抓取占比。如果大量抓取停在深页码,说明边界没设好。

关于 rel="next" 和 rel="prev"

这两个标签曾被用来标记分页序列,后来主流搜索引擎已经不再把它们当作索引信号。现在更实际的做法是:让分页地址本身可抓取、可访问,同时用 canonical 把重复的列表内容归拢到规范地址,必要时用 noindex 处理没有独立价值的翻页页。不同站点情况不同,先小范围试,再看日志和索引数据的变化。

分页的设计目标不是“让蜘蛛翻得更深”,而是让需要被看到的内容有一个清楚、有限的路径。

分页和 URL 发现的关系

站在 URL 发现的角度,列表页是最主要的入口之一。新内容发布后,能不能通过栏目第一页被找到,比能不能通过第 15 页被找到重要得多。所以列表排序逻辑值得留意:按发布时间倒序,让新内容出现在靠前的位置;同时避免把一堆长期不更新的旧条目反复推到列表顶部。如果站点同时使用站点地图、站内推荐位、相关阅读等多个入口,分页只要做到“干净、有边界、路径明确”,就已经完成它的任务了。

定期回看的两个动作

  • 每季度抽查几个主要栏目的分页,看有没有栏目因为内容下线出现空页或断裂。
  • 结合蜘蛛日志和索引数据,观察翻页地址的抓取与收录比例,发现异常再调整,不必频繁改动。