收录量上涨通常是好事,但如果涨上来的都是你并不希望被搜到的页面,麻烦就来了。这类情况常被称作「索引膨胀」:站点里真正有价值的页面只有几百个,索引里却躺着几千甚至几万条 URL,其中大部分是筛选结果页、分页尾页、空列表、用户中心快照之类。
索引膨胀是怎么形成的
多数情况下不是蜘蛛乱抓,而是站点主动给出了太多可抓、可索引的入口。
- 参数组合爆炸:筛选、排序、分页参数自由组合,同一个列表页能裂变出成百上千个 URL。
- 空结果页可访问:筛选后没有任何结果,页面照样返回 200 并渲染整套模板。
- 模板化聚合:标签页、作者页、地区页由同一套模板批量生成,正文差异极小。
- 功能页暴露:购物车、登录后页面、打印页、站内搜索结果页没有被挡在抓取范围之外。
先分清是真膨胀,还是只是看着多
判断标准不是绝对数量,而是每个页面有没有独立价值。一个只有三条商品的分类页可以保留,一个把价格区间切成二十段的筛选页通常没必要。
- 用站内搜索指令抽查某个目录,看标题和摘要是否高度雷同。
- 在索引覆盖率报告里,重点看「已抓取,尚未编入索引」和「重复网页,搜索引擎选择的规范网页与用户指定的不同」这两类的占比与示例 URL。
- 随机抽二十条代表性地址,逐条问自己:这个页面能解决什么搜索需求?答不上来的,就属于要收口的范围。
四种处理方式,不要只挑一种
保留
有独立内容、有搜索需求、能被自然链接指向的页面,老老实实保留。不要因为一时焦虑就把整站批量处理。
合并与规范化
近似重复的页面优先考虑合并:把多段筛选参数统一指向一个主地址,用 canonical 声明首选版本,站内链接也指向同一个 URL。这比直接屏蔽更稳妥,因为原有链接价值还能留住。
只屏蔽索引
页面仍需被用户访问、也能被蜘蛛抓到,但不希望出现在搜索结果里,用 noindex。客服帮助页、临时活动页常属于这一类。
彻底关闭
已经下线、不会再恢复的页面,返回 404 或 410,让搜索引擎自然剔除。长期挂着一个内容为空的 200 页面,反而会一直占着抓取资源。
注意一个常见误区:如果 robots.txt 已经把某个目录挡住,蜘蛛就抓不到页面上的 noindex 标签,noindex 也就不会生效。想让它退出索引,就要允许抓取、同时返回 noindex;想省抓取预算,就得接受它可能长期留在索引里。两者很难同时满足。
收口之后看什么
调整生效需要时间,观察周期按周而不是按天比较合适。可以关注三个方向:一是目标目录的抓取频次是否更集中到重要页面上;二是索引覆盖率报告里有效页面与排除页面的比例变化;三是自己站内搜索抽查时,雷同标题是否减少。如果发现重要页面反而被误挡,及时回滚对应规则即可。
索引膨胀本质上是站点结构和模板策略的问题,处理起来更像收拾房间,而不是一次性手术。想清楚每个目录存在的理由,比堆叠各种防抓取技巧更管用。