列表页和分页是很多站点流量结构里被忽略的一块。首页、栏目页、文章页往往有人盯着,而第 3 页、第 8 页的翻页链接,常常是建站时随手生成、之后几年没人再看的地方。蜘蛛顺着这些链接走,访客也顺着这些链接翻,两边都在这条路上花时间。
分页为什么容易出问题
分页天然带着“重复”和“无限”两个属性。同一个栏目下的内容,会被首页、第 2 页、标签页、归档页反复列出;而只要不设边界,翻页链接可以一直往下生成。对访客来说,翻到第 20 页已经很难找到东西;对蜘蛛来说,那是一串内容相似、价值递减的地址。
几种常见的分页写法,各有各的麻烦
- 全量展开式:列表页一次性输出几百条链接,页面体积大,链接权重被摊薄,新内容淹没在旧内容里。
- ?page=1 与栏目首页并存:两个地址展示完全相同的列表,没有 canonical 或跳转区分,容易被当成重复页面。
- 无限滚动:访客体验不错,但后续内容靠脚本加载,如果链接没有落到 HTML 里,蜘蛛往往只看到第一屏。
- 翻页链接用相对路径或脚本跳转:路径层级算错,或者必须点击才能触发,抓取路径就断了。
- 空结果页也返回 200:翻到超出范围时返回一个空白列表页,蜘蛛会继续往里走。
一份可以照着做的自查清单
- 打开栏目第一页,查看源码里翻页链接是不是标准的 <a href>,路径是否为绝对地址。
- 确认第 1 页与栏目首页的关系:保留一个规范地址,另一个用 301 或 canonical 指向它。
- 给分页设置上限。内容量不大的栏目,翻到一定页数后返回 404,或干脆不输出下一页链接。
- 检查每页输出多少条。常见的 10 到 30 条比较稳妥,具体看页面体积和栏目更新频率。
- 列表页上的标题、摘要最好和文章页保持区别,不要整段复制正文开头。
- 翻页地址里不要叠加跟踪参数,否则每翻一页都会生成一批新地址。
- 如果用了无限滚动,确认后续内容有可被抓取的链接入口,比如“查看全部”的分页版本。
- 在日志里看蜘蛛对分页地址的抓取占比。如果大量抓取停在深页码,说明边界没设好。
关于 rel="next" 和 rel="prev"
这两个标签曾被用来标记分页序列,后来主流搜索引擎已经不再把它们当作索引信号。现在更实际的做法是:让分页地址本身可抓取、可访问,同时用 canonical 把重复的列表内容归拢到规范地址,必要时用 noindex 处理没有独立价值的翻页页。不同站点情况不同,先小范围试,再看日志和索引数据的变化。
分页的设计目标不是“让蜘蛛翻得更深”,而是让需要被看到的内容有一个清楚、有限的路径。
分页和 URL 发现的关系
站在 URL 发现的角度,列表页是最主要的入口之一。新内容发布后,能不能通过栏目第一页被找到,比能不能通过第 15 页被找到重要得多。所以列表排序逻辑值得留意:按发布时间倒序,让新内容出现在靠前的位置;同时避免把一堆长期不更新的旧条目反复推到列表顶部。如果站点同时使用站点地图、站内推荐位、相关阅读等多个入口,分页只要做到“干净、有边界、路径明确”,就已经完成它的任务了。
定期回看的两个动作
- 每季度抽查几个主要栏目的分页,看有没有栏目因为内容下线出现空页或断裂。
- 结合蜘蛛日志和索引数据,观察翻页地址的抓取与收录比例,发现异常再调整,不必频繁改动。