网站收录

分页列表被大量收录:翻页页面的取舍与收口顺序

列表翻页被搜索索引收录,既有可能是正常入口,也可能只是重复内容占着抓取配额。本文把翻页页分成系列分页、列表分页、筛选分页三类,按搜索需求、内容差异、抓取占比和链接发现四个角度判断是否保留收录,并梳理 canonical、noindex、翻页深度限制的适用场景与副作用,最后给出可执行的核对顺序。

网站收录

分页列表被大量收录:翻页页面的取舍与收口顺序

站点的列表翻页(常见的 /page/2、?paged=3、list_2.html)被搜索索引收进去,是很多站点都会遇到的情况。它未必是坏事:有些翻页页确实有独立入口价值,也有些纯粹是重复内容的载体,占着抓取配额。难点在于两类页面没有明显的分界线,所以要先判断角色,再决定收口方式,而不是统一一刀切。

先给翻页页分个类

按页面的实际功能分成三类,处理方式会清楚很多:

  • 系列内容分页:长文、连载、教程的第二三页,用户会顺着读下去,页面上有内容增量。
  • 列表导航分页:文章列表、商品列表翻页,主要作用是发现新链接,页面之间差异有限。
  • 筛选排序分页:带筛选参数或排序参数生成的组合,数量容易失控,重复度也往往偏高。

判断值不值得收录的几个角度

  1. 有没有搜索需求:如果用户会直接搜某类内容的第二页、第三页,保留收录通常更合理。
  2. 内容是否只是重复:翻页页如果只有标题列表变化,正文结构与第一页高度相似,价值有限。
  3. 抓取日志里的占比:翻页页吃掉大量抓取次数、挤占详情页,就要考虑收口。
  4. 被发现的新链接:如果详情页主要靠列表页被发现,收口时要保证内链通路不被切断。

常见收口方式与各自的副作用

canonical 指向第一页

适合翻页只是同一批内容另一种排列的情况。要注意第一页本身必须自指,不要出现整条链路都指向别处的循环。若某一页确实有独立价值,就不要把它并到第一页。

noindex, follow

适合不希望翻页页进入索引、但仍希望蜘蛛顺着链接爬到详情页的场景。写成 noindex, nofollow 会同时断掉链接发现,除非你另有替代入口。

限制翻页深度与链接暴露

比如只让前几页在站内可点,后面的页靠接口或按需加载。这种做法会让部分页面难以被抓到,取舍时要把用户能否到达和蜘蛛能否到达分开看。

一个容易忽略的冲突:同一批翻页页里,有的用 canonical 指向第一页,有的用 noindex,还有的两种都写。指令混用时搜索引擎会自行判断,最终结果往往与预期不一致。改之前先把现状列成表,比改之后反复猜要省事。

调整之后的核对顺序

  1. 抓取日志:看翻页页的抓取频次是否下降,详情页是否相应增加。
  2. 索引状态:抽查若干翻页 URL,确认是移出还是仍在,留意生效本身有延迟。
  3. 内链通路:确认深层详情页仍有可被抓到的入口,没有变成孤岛。
  4. sitemap 与 robots:提交的文件里不要再包含已经不打算收录的翻页地址,避免信号互相矛盾。

记录变更,别反复折腾

翻页收口很少一次到位。建议把改动时间、改动方式、当时的抓取与索引数据记在同一处,隔一段时间再看趋势。多次来回切换 canonical 与 noindex,反而会让这类页面在搜索引擎眼中的处理方式更不稳定。