分页在站内很常见,但很多人把它当成一个问题来处理,结果规则互相打架:既想让搜索引擎抓到列表深处的条目,又嫌抓取额度被翻页浪费掉。实际动手时,第一步不是设规则,而是先把分页分成两类——列表分页和内容分页,它们的意图、价值和收敛方式都不一样。
两类分页,要解决的问题不同
列表分页:为发现更深的内容服务
分类页、归档页、商品列表页的「下一页」,本质上是一条发现路径。它的价值不在于页面本身有多少内容,而在于通往后面几页里的条目。判断要不要保留,看的是:这些深页里有没有值得单独收录的 URL。
内容分页:为阅读体验服务
把一篇长文拆成 /article/1、/article/2,或者把图集拆成多页。这类分页通常没有独立的搜索需求,用户也很少从第 3 页开始读。它的信息本来是连续的,被拆开后每一页都像「半篇文章」,容易和主页面形成近似重复。
列表分页:按深度和价值分层
深翻页的价值通常是递减的。前几页可能还有独立搜索需求,到了第 20 页基本只是历史归档。一个比较稳的做法是:
- 前几页保持可抓取、可索引,让链接正常传递;
- 更深的页面减少站内入口,不必刻意出现在主导航或侧栏;
- 确实没有价值的深页,可以不加 noindex,只收回链接,让它自然停留在「已发现但未收录」的状态;
- 如果决定用 noindex,要注意页面上的链接仍会被跟随,别指望它顺手切断发现路径。
这里常见的坑是把 noindex 和「节省抓取额度」画等号。noindex 只影响索引,不阻止抓取;真正减少抓取的,是减少内链入口、压缩可翻页数、以及让翻页 URL 不要被反复重新生成。
内容分页:能不分就不分
内容分页的第一选择是不分页。单页长文如果加载不慢,通常更利于阅读,也更少出现重复信号。如果因为历史原因已经拆开,至少要保证几个关系明确:
- 每一页都能回到第一页,第一页也能通向后续页,链接关系清晰;
- canonical 默认指向自己,不要把所有分页都指向第一页,那会让后续页的内容彻底失去索引机会;
- 如果希望聚合展示,可以考虑保留一个「查看全部」版本,并让分页指向它;
- 不要在分页上再叠加筛选参数,参数与分页混在一起时,组合出来的 URL 会成倍增长。
处理顺序:先看数据,再定规则
- 从日志和收录数据里,找出实际被抓取最多的分页 URL 模式;
- 判断这些页面有没有独立搜索需求,还是纯粹的中转页;
- 按「保留 / 收回链接 / noindex」三档处理,不要一刀切;
- 规则上线后,观察抓取分布是否转向更关键的页面,而不是只盯着收录总数。
分页处理的目标不是让所有翻页都消失,也不是让它们全部进索引,而是把抓取额度留给真正有需求的页面。
几个容易忽略的细节
- 分页 URL 尽量用干净的路径或标准参数,避免每次渲染都生成不同的排序参数;
- 移动端和 PC 端的分页写法保持一致,别出现两套地址;
- 站点地图里只放需要被发现的页码,不要把全部翻页都塞进去;
- 改规则后给搜索引擎一点重新抓取的时间,短期内收录数量波动属于正常现象。
分页本身不是问题,问题在于把两类目的不同的页面用同一套规则处理。先分清它服务于「发现」还是「阅读」,再决定保留、收敛还是不放行,顺序就不会乱。