站点运营

站点运营:分页与聚合页自查,别让翻页和标签页堆出重复地址

列表页一多,分页、标签聚合和筛选参数就会同时存在。本文梳理三类页面的区别,给出分页地址稳定性、聚合页重复内容、空结果页状态码、canonical 与 noindex 的处理思路,并附一份可直接执行的检查清单,帮助运营者把抓取预算留给真正的内容页。

站点运营

站点运营:分页与聚合页自查,别让翻页和标签页堆出重复地址

列表页多起来以后,分页、标签聚合、条件筛选三类地址会同时存在。它们本身没有问题,问题在于没人管:同一个列表被拆成几十个地址,蜘蛛在其中来回打转,真正的内容页反而分不到多少抓取机会。这篇讲的是怎么把这三类页面理清楚。

先分清三类页面

  • 分页:/list/、/list/page/2/ 这类,按时间或热度往下翻。
  • 聚合页:标签、作者、专题、归档,按主题把跨栏目的内容聚在一起。
  • 筛选页:颜色、价格、地区等参数组合,数量随条件相乘。

三类页面用途不同,处理方式也不该一样。分页通常是用户和蜘蛛进入深层内容的通道;聚合页有一部分具备独立价值;筛选页大多只对当前这位访客有意义。

分页自查要点

  • 每页是否有可点击的上一页、下一页链接,而不是纯 JS 的“加载更多”。
  • 分页地址是否稳定,参数顺序是否统一,避免 ?page=2&sort=x 与 ?sort=x&page=2 变成两条地址。
  • 第一页是否与栏目首页地址重复,如果重复,应选其中一个作为规范地址。
  • 深分页(例如第 50 页)是否还有独立价值,是否应该保留链接但加上 noindex。
  • 列表项的标题和摘要是否随内容更新,别让第 3 页长期停在三年前的内容上。

聚合页与筛选页

  • 标签页只有一两条内容时,是否值得作为独立页面存在。
  • 筛选后无结果的空页面,返回的是 200 还是 404、410。
  • 筛选参数是否会无限组合,是否该限制可被抓取的参数范围。
  • 聚合页的标题与描述是否由模板直接拼出来,是否与栏目页高度雷同。
  • 是否需要 canonical 指向上层栏目,或者直接 noindex, follow。

对外暴露的三种方式

常见做法有三种:允许抓取并收录;允许抓取但不收录(noindex);不允许抓取(robots 限制或链接不可达)。选择取决于这个页面有没有独立的搜索需求。多数筛选页适合第二种;深分页适合保留链接但配合 noindex;纯排序、纯会话参数适合第三种。要注意 noindex 需要页面能被抓到才会生效,先用 robots 屏蔽再加 noindex,两者会互相抵消。

判断标准其实很简单:如果这个地址被单独搜到时,用户会觉得有用,就留着;如果它只是某位访客当时的一次筛选结果,就别让它进索引。

一次可执行的检查清单

  1. 导出近 30 天被访问的列表类地址,统计带参数的地址数量。
  2. 抽样 20 个聚合页,看内容是否与其他页面大面积重复。
  3. 检查分页链接是否为 a 标签,关闭 JavaScript 后能否点击。
  4. 检查筛选页是否会把蜘蛛引向无穷组合,必要时在 robots 中限制参数。
  5. 检查空结果页的状态码与提示文案,别让它看起来像正常内容页。
  6. 观察日志中列表页与内容页的抓取比例,判断是否失衡。

这类自查不必一次做完,先处理重复率最高、被抓取最多的一批,再回头看长尾。改完之后用日志观察列表页的抓取量是否下降、内容页是否上升,比单看收录数字更有参考价值。