站点运营

站点运营:分页与翻页自查,别让蜘蛛在第 N 页迷路

栏目内容变多后,分页几乎绕不开,但翻页链接不可抓、参数组合无限、canonical 指错,都会让蜘蛛把抓取预算耗在翻页上。本文从翻页链接可抓取性、参数收敛、canonical 与站点地图的边界、空结果页处理等角度,给出一份可逐条对照的分页自查清单。

站点运营

站点运营:分页与翻页自查,别让蜘蛛在第 N 页迷路

栏目内容多了,分页几乎是必然会出现的结构。它对人来说只是“下一页”,对搜索引擎蜘蛛来说却是一串需要逐页跟进的 URL。分页没梳理清楚,常见的结果是:蜘蛛把抓取预算花在几十页的翻页上,真正重要的详情页反而排到了后面;或者翻页链接是脚本生成的,蜘蛛根本点不动。下面这份清单围绕分页结构展开,不绑定具体平台,可以对着自己的站点逐条核对。

先分清站点上有哪几种分页

不同形态的分页,处理方式差别很大,先归类再动手:

  • 列表分页:栏目页、标签页、搜索结果页上的第 2、3、4 页。
  • 内容分页:一篇长文被切成 1/2/3 页,正文本身被拆分。
  • 评论或问答分页:主体内容在第一页,后续页只有用户生成内容。
  • 伪分页:滚动加载或“加载更多”按钮,地址栏 URL 不变。

逐条自查

1. 翻页链接要能被正常抓取

用 span 标签加 onclick、或者靠按钮触发接口再拼接跳转的翻页,蜘蛛往往跟不上。自查方式很简单:在浏览器里禁用 JavaScript,看下一页链接是否还在、href 是否完整。能被点击、能拿到 href 的链接,才是蜘蛛能走的路。

2. 别让分页产生无限组合

列表页常带排序、筛选、视图切换等参数,参数一组合,理论上是无穷的。建议把影响内容集合的参数控制住,只保留少数几个确定可抓的组合;纯展示类的排序(按价格、按销量、按时间)可以用按钮或锚点形式,不必生成独立 URL。

3. canonical 不要乱指

列表分页的每一页内容并不相同,把第 2 页 canonical 指向第 1 页,等于告诉蜘蛛这些页面不用单独看。如果第 1 页不打算保留,可以直接用 noindex;如果希望保留,就让各页自指,或用 rel="next"、rel="prev" 表达顺序关系(这类标签主流搜索引擎已不再作为收录信号,但仍有梳理结构的作用)。关键是一致:别一边把分页 canonical 指向首页,一边又在站点地图里提交全部分页。

4. 站点地图与分页的边界

把成百上千个分页 URL 全塞进站点地图,通常没有意义。建议只提交第 1 页和少量有独立价值的深页;内容分页(长文拆页)可以提交全部,因为每一页都承载正文。

5. 内容分页要保证正文连续

把长文拆成多页时,每页都要有清晰的标题和成段正文,避免出现只有两三行的空壳页。同时检查每页首屏是否有足够内容,别让用户和蜘蛛都要点好几次才看到正文。

6. 空结果页与越界页

筛选条件没有结果时,如果仍返回 200 并渲染一个空列表,很容易形成大量内容雷同的低质页面。这类情况返回 404 或给出明确的“无结果”提示,通常比留着更好。翻到超出范围的页码时同理。

用日志和数据验证

调整之后,从两个方向看效果:一是服务器日志里分页 URL 的抓取比例,是否还有大量深页码请求;二是搜索结果里的落地页分布,是否过度集中在少数几个分页上。这两个信号能反映结构问题有没有缓解,但不能保证收录或排名的变化,别把它们当成结果指标。

分页本身不是问题,问题在于它悄悄吃掉了抓取预算,却没有把蜘蛛带到该去的地方。

把上面几条对着自己的站点过一遍,重点不在工具,而在于想清楚:每一页分页对用户和蜘蛛分别有什么价值。有价值的保留并让它可抓取,价值重复的合并或收敛,分页结构自然就清爽了。