站点运营

站点运营:列表分页自查,别让翻页链接断在半路

列表页常是站内流量最大的入口,但翻页往往最容易被忽略:链接写在 JS 里、参数被 robots 屏蔽、第一页有多个地址、第 N 页标题千篇一律。本文梳理分页常见的几个坑,给出一份可以直接照着做的自查清单,帮蜘蛛顺利走到后面的内容。

站点运营

站点运营:列表分页自查,别让翻页链接断在半路

列表页是很多站点流量最大的入口:新闻列表、商品分类、标签聚合、作者页,都靠翻页来承接更多内容。但翻页也常常是最容易被忽略的地方——编辑只管发文章,模板只在第一页加链接,蜘蛛爬到某一页之后就找不到继续往下走的入口了。下面梳理列表分页常见的几个坑,以及可以马上做的自查动作。

一、翻页链接是不是真的可点、可爬

先别急着看代码,用最土的办法验证:打开页面,关掉 JavaScript,或者用开发者工具查看渲染前的 HTML 源码,看看“下一页”的链接是不是本来就在里面。

  • 分页按钮如果是用 onclick 事件或前端路由实现的,源码里可能根本没有可跟随的地址,蜘蛛拿不到下一页的入口。
  • 有些模板把“下一页”写成表单提交,这类请求无法被正常抓取。
  • 翻到最后一页时按钮变灰,本身没问题,但要注意别把整块导航一起删掉,导致前面的页也失去出口。

二、分页 URL 的几种写法

路径式:/news/page/2/

这种写法层级清晰,用户和蜘蛛都比较容易理解。注意两点:一是第一页不要同时存在 /news/ 和 /news/page/1/ 两个版本;二是明确哪一个才是规范地址,避免同一个列表出现多个入口。

参数式:/news?page=2

参数式实现简单,但容易被误伤。检查一下 robots.txt 里有没有把带 page 参数的地址整段屏蔽,那等于亲手砍掉所有翻页。另外,如果站内搜索也用同名的参数,两者混在一起会让统计和排查都变麻烦。

三、列表页的重复内容

同一个列表翻到第三页时,标题、描述、H1 往往还是“最新文章 - 第 3 页”,内容结构也和第一页高度相似。数量一大,整站的页面质量就被稀释了。

  • 给每页标题加上页码,让它有基本区分度。
  • 描述里带上该页特有的信息,比如本页第一篇的标题或所在栏目。
  • 如果列表页本身不打算被收录,用 meta robots 的 noindex,follow,保留链接通路即可;不要直接屏蔽抓取,那会连带切断后续内容的发现路径。

四、无限滚动和“加载更多”

无限滚动对用户友好,对蜘蛛不太友好——不滚动就不加载。常见的折中做法是保留一条纯链接的分页路径。

  • 首屏之后提供“下一页”的真实链接,哪怕大多数用户不会去点。
  • 或者提供“查看全部”页面,但要先评估这个页面会不会太长、太慢。
  • “加载更多”按钮最好同时是一个可访问的链接,至少保证有一份地址能被追踪到。

五、分页和内链、站点地图的关系

有些站点把翻页放在脚本里,站点地图里又只提交了第一页,结果第二页之后的内容只能靠外链和随机抓取慢慢被发现。可以从这几个地方入手:

  1. 把分页链接做成普通链接,放在列表底部,不要藏在浮层或折叠面板里。
  2. 确保每一页都能从上一页的“下一页”一路点到,而不是只能从第一页跳转到任意页。
  3. 站点地图不必把所有分页都塞进去,但重点栏目的前几页可以酌情提交。
  4. 详情页之间做相关推荐,让内容即使不经过列表也能被横向走到。

六、一份简单的自查清单

  1. 关掉 JavaScript,看翻页链接是否出现在源码中。
  2. 点开第 2 页、中间某页、最后一页,确认返回 200,而不是 404 或一直转圈。
  3. 检查 robots.txt 有没有误屏蔽分页路径或 page 参数。
  4. 确认列表首页只有一个地址版本,没有重复入口。
  5. 抽查几个列表页的标题和描述,看是否千篇一律。
  6. 翻抓取日志,看蜘蛛访问分页的比例;如果长期只有第一页,说明链路大概率断了。
分页不是纯技术细节,而是内容的最后一公里。翻页走不通,后面再好的内容也只能躺在数据库里。