大多数站点关心的是“收录不够”,但另一种情况同样会拖累站点:本该被挡住的低价值页面大量进入索引,也就是常说的索引膨胀。它不会立刻带来可见的故障,却会让站点整体质量信号被稀释,也会让真正重要的页面更难被稳定地抓取和评估。
索引膨胀通常从哪来
搜索引擎判断“这个 URL 是否值得收录”,主要看它是否有独立、可用的内容。当同一套模板批量生成大量内容稀薄、彼此高度相似的页面时,就很容易出现收录量上涨、但有效页面没涨的情况。
- 参数组合页:排序参数、追踪参数、多条件筛选叠加,生成成百上千个内容雷同的 URL。
- 空结果页:筛选后没有结果,页面依然返回 200,正文只剩一句提示。
- 历史遗留页:改版、下线、合并后仍然可以访问,内容已经过时或与现有页面重复。
- 分页与归档:数量庞大的归档页、标签页,正文只有标题列表。
先分类,再决定留还是撤
收缩之前要先区分两种页面:一种是确实对用户有用、只是写法有问题的页面,另一种是本身就不该存在、只因为技术原因被生成的页面。前者通常通过规范化写法就能解决,后者才需要真正把它挡在索引之外。
处理顺序建议
- 先把同类 URL 找齐。用抓取日志、站点地图、平台后台的收录数据交叉对照,确认膨胀集中在哪几类模板。
- 能合并的先合并。内容高度重合的页面,优先考虑整合成一页,而不是简单地批量 noindex。
- 确实无价值的,再考虑挡收录。这时才进入 noindex、robots.txt、返回正确状态码等具体手段。
- 处理完一批再观察一批,避免一次性大面积改动导致难以判断效果。
几种手段的区别别搞混
robots.txt 的 Disallow 只是阻止抓取,被挡住的页面如果之前已被收录,搜索引擎无法读取页面上的 noindex,反而可能长期停留在索引里。noindex 需要蜘蛛能抓到页面,才读得到这条指令。而如果页面已经彻底不需要存在,返回 404 或 410 往往比 noindex 更干脆,也更容易让索引里的记录自然退出。
canonical 则适用于“页面本身有价值、只是想说明谁是主版本”的情况。把它当成删除工具来用,通常会失效,因为 canonical 只是建议而并非强制。
提醒:这些手段都不会立刻反映在索引数据上,索引的收缩通常需要数周甚至更久,观察时以趋势为主,不要因为几天没变化就反复调整策略。
收缩之后该看什么
不要只盯着收录总量这一个数字。更有意义的观察维度包括:重要页面的抓取频次是否回升,站内几类核心模板的收录比例是否改善,抓取日志里低价值 URL 的占比是否下降。收录总量下降但核心页面表现变好,往往是正常且积极的结果。
另外要注意抓取与收录是两件事。把无效 URL 挡在抓取之外,可以节省抓取配额,但这本身不等于清理索引;反过来,被 noindex 的页面仍可能被抓取一段时间。两者需要分别验证。
常见误区
- 看到收录量下降就立刻回滚:如果下降的正是低价值页面,这可能是预期效果。
- 用 robots.txt 处理已收录页面:容易被卡住,处理周期更长。
- 对整站目录一刀切:可能误伤仍有流量、仍有价值的页面,建议按模板、按目录分阶段处理。
- 只做一次就结束:新参数、新模板会持续产生新的低价值 URL,需要定期复查生成规则。
索引膨胀的本质是“站点生成了太多不值得存在的 URL”。与其在收录量上做文章,不如回到源头,控制 URL 的生产规则,让每一个能被访问到的地址都有存在的理由。