做站点运营的人经常会遇到一个现象:详情页没几条进索引,分页列表却一条接一条被收录,翻到第 8 页、第 20 页依然能在搜索结果里看到。这不一定是坏事,但如果不加区分地放任,索引里会堆积大量低价值 URL,真正需要被发现的页面反而被稀释。
分页为什么容易被大量收录
分页有几个天然优势:链接数量多、层级浅、更新频繁、指向它的内链稳定。对搜索引擎来说,这类 URL 发现成本很低,抓取也很顺。相反,一个新详情页可能只挂在列表页底部,还要经过若干层跳转才能被发现。抓取机会的分配本身就不均衡,收录结果自然也会偏。
这里要区分两件事:抓取是过程,收录是结果。爬虫来了很多次,不代表页面一定进索引;内容质量、重复程度、是否被规范到别的 URL,都会影响最终取舍。
分页去留的判断维度
一看内容是否自成一体
如果分页上除了标题和日期,只有一串链接,内容与第 1 页高度重合,它的独立价值就很有限。反过来,有些分页承担了真实的浏览需求,比如按时间归档、按分类翻页,用户确实会一页页看下去,那就不必急着收口。
二看是否有更合适的规范目标
同一组分页可以用 canonical 指向系列首页,让搜索引擎知道这些 URL 属于同一组内容。但要注意:规范标签不等于删除,也不保证会被完全采纳,它只是表达偏好。指向一个不相关或已 404 的地址,反而会制造新的问题。
三看抓取成本与索引规模
如果站点能组合出几十万个筛选与翻页 URL,抓取预算会被大量消耗在翻页上,新内容与重要页面的发现速度就会变慢。这时问题往往不是「要不要收录分页」,而是「要不要让这么多分页 URL 被生成出来」。
常见的处理思路
- 保留可控分页:只保留有真实浏览价值的翻页,例如分类页的前几层。
- 限制无限翻页:用「加载更多」或只保留前若干页可点,避免生成到第 100 页。
- 收敛参数:排序、视图切换等参数尽量统一,不为每种组合生成独立可索引地址。
- 规范到系列首页:对确定为同一组的分页给出统一规范目标,并保持该目标可访问。
- 让列表保持更新:如果翻页只是把旧内容反复重排,长期价值会持续下降。
动手前的自查顺序
- 先看搜索表现:分页是否有真实的展示与点击,还是只是躺在索引里。
- 再看日志:爬虫在分页上花了多少请求,占总量比例如何。
- 检查参数生成规则:是否存在可以组合出大量 URL 的入口。
- 确认 canonical 与 robots 设置是否指向可用地址,避免自相矛盾。
- 改完之后留出观察期,索引变化通常不会立刻发生。
把分页当成「有内容的页面」还是「导航的延伸」,决定了你该保留它还是收口它。判断标准应该是用户会不会真的用它,而不是搜索引擎有没有收录它。
容易踩的坑
- 直接用 robots.txt 封掉分页,导致爬虫无法顺着链接发现更深的详情页。
- 把所有分页都规范到第 1 页,结果第 1 页承载了过多本不属于它的词。
- 只盯着收录数量,不看这些页面实际带来了什么。
分页被收录本身不是错误,它只是需要被纳入整体策略来管理。先明确哪些分页有独立价值,再决定保留、合并还是限制生成,比单纯追求「收录多」或「收录少」更有意义。