网站收录

分页页面的收录处理:先分清列表分页与内容分页,再定保留还是收敛

分页处理常被当成一个问题,结果规则互相冲突。本文把分页拆成列表分页与内容分页两类:前者服务于深度内容的发现,后者服务于阅读体验。分别说明该保留哪些页码、哪些只需收回链接、哪些适合 noindex,并给出从日志数据出发的排查顺序,避免抓取额度被无效翻页占用。

网站收录

分页页面的收录处理:先分清列表分页与内容分页,再定保留还是收敛

分页在站内很常见,但很多人把它当成一个问题来处理,结果规则互相打架:既想让搜索引擎抓到列表深处的条目,又嫌抓取额度被翻页浪费掉。实际动手时,第一步不是设规则,而是先把分页分成两类——列表分页和内容分页,它们的意图、价值和收敛方式都不一样。

两类分页,要解决的问题不同

列表分页:为发现更深的内容服务

分类页、归档页、商品列表页的「下一页」,本质上是一条发现路径。它的价值不在于页面本身有多少内容,而在于通往后面几页里的条目。判断要不要保留,看的是:这些深页里有没有值得单独收录的 URL。

内容分页:为阅读体验服务

把一篇长文拆成 /article/1、/article/2,或者把图集拆成多页。这类分页通常没有独立的搜索需求,用户也很少从第 3 页开始读。它的信息本来是连续的,被拆开后每一页都像「半篇文章」,容易和主页面形成近似重复。

列表分页:按深度和价值分层

深翻页的价值通常是递减的。前几页可能还有独立搜索需求,到了第 20 页基本只是历史归档。一个比较稳的做法是:

  • 前几页保持可抓取、可索引,让链接正常传递;
  • 更深的页面减少站内入口,不必刻意出现在主导航或侧栏;
  • 确实没有价值的深页,可以不加 noindex,只收回链接,让它自然停留在「已发现但未收录」的状态;
  • 如果决定用 noindex,要注意页面上的链接仍会被跟随,别指望它顺手切断发现路径。

这里常见的坑是把 noindex 和「节省抓取额度」画等号。noindex 只影响索引,不阻止抓取;真正减少抓取的,是减少内链入口、压缩可翻页数、以及让翻页 URL 不要被反复重新生成。

内容分页:能不分就不分

内容分页的第一选择是不分页。单页长文如果加载不慢,通常更利于阅读,也更少出现重复信号。如果因为历史原因已经拆开,至少要保证几个关系明确:

  1. 每一页都能回到第一页,第一页也能通向后续页,链接关系清晰;
  2. canonical 默认指向自己,不要把所有分页都指向第一页,那会让后续页的内容彻底失去索引机会;
  3. 如果希望聚合展示,可以考虑保留一个「查看全部」版本,并让分页指向它;
  4. 不要在分页上再叠加筛选参数,参数与分页混在一起时,组合出来的 URL 会成倍增长。

处理顺序:先看数据,再定规则

  1. 从日志和收录数据里,找出实际被抓取最多的分页 URL 模式;
  2. 判断这些页面有没有独立搜索需求,还是纯粹的中转页;
  3. 按「保留 / 收回链接 / noindex」三档处理,不要一刀切;
  4. 规则上线后,观察抓取分布是否转向更关键的页面,而不是只盯着收录总数。
分页处理的目标不是让所有翻页都消失,也不是让它们全部进索引,而是把抓取额度留给真正有需求的页面。

几个容易忽略的细节

  • 分页 URL 尽量用干净的路径或标准参数,避免每次渲染都生成不同的排序参数;
  • 移动端和 PC 端的分页写法保持一致,别出现两套地址;
  • 站点地图里只放需要被发现的页码,不要把全部翻页都塞进去;
  • 改规则后给搜索引擎一点重新抓取的时间,短期内收录数量波动属于正常现象。

分页本身不是问题,问题在于把两类目的不同的页面用同一套规则处理。先分清它服务于「发现」还是「阅读」,再决定保留、收敛还是不放行,顺序就不会乱。