站点运营

站点运营:分页与列表页自查,别让翻页翻出重复和断链

分页和列表页是内容站最常见的页面类型,也容易产生重复、漏页和断链。本文从链接可抓取、canonical、翻页顺序、筛选组合、标题描述和日志验证几个方面,整理一份分页自查清单。

站点运营

站点运营:分页与列表页自查,别让翻页翻出重复和断链

只要站点有栏目、标签、搜索结果或归档,就离不开分页。分页做得好,用户能顺着翻,蜘蛛也能顺着发现旧内容;分页做得随意,就很容易出现重复页面、断链、空页,甚至让新内容迟迟进不了抓取队列。本文从站点运营角度,整理一份分页与列表页自查清单。

先看翻页链接是不是真链接

很多分页组件用 JavaScript 点击加载,或者用按钮加事件,页面地址不变。这样做用户可能觉得流畅,但蜘蛛不一定能走到第二页、第三页。更稳妥的做法,是让每一页都有独立的、可访问的 URL,并且用普通的 a 标签输出。检查时可以从第一页开始,手动点几页,右键复制链接,确认地址有变化,而且直接粘贴到新窗口能打开。

如果确实要用无限滚动,至少保留一个传统分页入口,比如“下一页”或“查看全部”,让没有执行脚本的客户端也能继续发现内容。

canonical 和重复内容

分页页面之间内容相似,但每一页又有不同条目,通常不需要把所有分页都 canonical 到第一页。更常见的做法是让每页 canonical 指向自身,同时确保第一页和其他页的标题、描述有所区别。如果列表页还带有排序参数,比如按时间、按热度、按价格,最好确认不同排序不会产生大量内容相同的地址。必要时可以在 robots 或参数处理上做限制,但不要误伤正常的翻页。

  • 检查每页 canonical 是否指向自身,而不是统一指向首页或列表第一页。
  • 检查排序参数、会话参数是否带来重复地址。
  • 检查空结果页、超出范围的页码是否返回合适状态码,而不是一律 200。

翻页顺序与断链

翻页最怕两件事:一是漏页,二是断页。漏页可能是页码计算错误、缓存分页失效,或者内容删除后没有重新归位。断页则是页码存在但打不开,或者返回空内容。运营侧可以定期从第一页翻到最后一页,重点看中间有没有跳号、重复、空页。如果栏目内容变动频繁,建议把这项检查放进月度维护,而不是等蜘蛛报错才处理。

另外要注意“下一页”和“上一页”的方向。有些模板在最后一页仍然输出下一页链接,点进去变成空结果或 404。对用户和蜘蛛来说,这都不是好体验。

分页和筛选组合

列表页常常同时支持分类、标签、排序、时间范围等筛选。筛选参数一多,组合数量会迅速膨胀。站点运营不需要禁止所有筛选,但要有边界。比如限制可选参数数量,对无意义组合返回 404 或 410,对重复内容做 canonical 归并。还要确认筛选后的列表页是否仍然有分页,不要出现“筛选后只显示前 20 条,没有下一页”的情况。

列表页标题与描述

分页页面的标题容易直接套用模板,比如“栏目名 - 第 2 页”。这本身可以接受,但最好加上该页的特征,比如时间范围或内容类型,避免所有分页标题几乎一样。描述也不要完全复制第一页。小改动就能降低重复感,也让用户从搜索结果里更容易判断这一页值不值得点。

用日志和站点地图做验证

自查不能只看页面。可以抽一段时间看服务器日志,观察蜘蛛是否抓取了第二页、第三页,抓取时返回的状态码是什么。如果发现大量 404、302 或 200 空页,就要回头检查分页逻辑。站点地图通常只放第一页或少数重要列表页,但不要因此忽略分页的可发现性。内链、站点地图、日志三者结合,才能判断分页通道是否真的畅通。

分页不是技术细节,而是内容发现路径的一部分。每页都能打开、有明确顺序、不重复刷地址,用户和蜘蛛才愿意继续往下翻。