站点运营

站点运营:分页翻页自查,别让列表翻页拖出一串低质入口

栏目翻页看起来不起眼,却常常是站内重复地址和低价值入口的集中来源。文章从翻页地址形式、超范围页码、列表内失效链接等角度,给出一份可以按顺序执行的自查清单,并说明合并、处理范围和改动记录的基本原则。

站点运营

站点运营:分页翻页自查,别让列表翻页拖出一串低质入口

很多站点的列表页,前几页还算干净,越往后翻越乱:同一批内容被拆成几十个地址,翻页参数各不相同,有的能打开、有的报错、有的直接跳回首页。平时看不太出来,但蜘蛛顺着翻页链接一路抓下去,很容易把时间花在这些重复列表上。

先看清自己的翻页长什么样

打开栏目列表,从第一页翻到最后一页,把地址记下来。常见的有几种:

  • 路径型:/news/page/2/,静态化程度高,地址稳定;
  • 参数型:/news?page=2,参数位置和顺序经常变;
  • 混合型:既有路径又有参数,翻几页之后两种形式混着出现;
  • 筛选叠加:分类、排序、页码一起出现,组合数量迅速膨胀。

形式本身没有绝对好坏,问题在于同一套翻页是否只对应一套地址。如果第二页既能用 A 地址打开,又能用 B 地址打开,内容完全一样,那这两条地址就在互相分流。

翻页页面上常见的四个问题

1. 翻到很后面还在被索引

栏目内容多的时候,翻到第三十页之后,往往只剩一些很早的旧文章摘要。这类页面给访客的价值不高,却和正文页抢抓取机会。可以结合站点实际情况,给超过一定深度的翻页加 noindex, follow,或者限制翻页链接的出现范围。

2. 页码翻过头,出现空列表

页码超过实际页数时,有的站点返回空白列表,状态码却是 200;有的直接报错。前者容易被当成正常页面,后者会浪费一次抓取。更稳妥的做法是:超出范围返回 404,或者跳回可用的最后一页。

3. 翻页链接全部挤在页面底部一小块

如果只有「上一页 下一页」两个链接,想深入只能一页页爬。栏目内容确实重要时,可以在列表底部给出若干页码或分段入口,让访客和蜘蛛都能快速跳到中段,而不是靠几十次点击。

4. 列表里混着失效链接

列表页是站内链接的集中出口,一条失效地址出现在列表里,会被反复抓到。定期抽查列表页里的链接状态,比等到日志里发现大量 404 更省事。

一份可以按顺序执行的自查清单

  1. 列出全站所有会产生翻页的栏目,标注地址形式;
  2. 逐页访问,确认同一页只对应一条地址,多余的做跳转或合并;
  3. 确认翻页页面的标题、描述是否只有页码差别,若高度重复可考虑统一处理;
  4. 检查第一页地址:列表首页是否和栏目首页是两条不同地址;
  5. 检查末页与超范围页码的返回状态;
  6. 抽查列表内链接,记录失效比例;
  7. 在日志或抓取记录里看翻页地址的抓取频次,判断是否偏高;
  8. 把处理规则写下来,方便下次改版时照着做。

处理时的几个原则

第一,能合并就合并。同一页内容有多条地址时,优先保留一条,其余 301 过去,而不是两套并行。

第二,不要一刀切。内容量大的核心栏目和深度很浅的边缘栏目,处理方式可以不同。全部 noindex 会把有用的入口也一起挡掉。

第三,改动要留记录。翻页规则涉及大量地址,改完最好在表格里记下时间、范围、规则,避免半年后自己也说不清哪条生效。

翻页不是必须消灭的东西,它只是站内导航的一种形式。关键是让每一条翻页地址都有明确用途,而不是因为程序默认生成就长期留在站上。

这类整理不需要一次做完。挑一个内容量大的栏目先试,把地址形式统一、超范围页码处理好,再推广到其他栏目,改动带来的影响也更容易观察。