很多站长把 site 结果的数字当成健康度指标,数字涨了就放心。但收录量只是一个体量数字,它不区分页面价值。当涨上去的是一批筛选组合、分页、归档和空结果页时,索引变大反而会带来副作用。
索引膨胀会带来哪些实际问题
- 抓取预算被摊薄:蜘蛛每次来访能抓的页面有限,低价值页面多了,真正需要更新的页面回访就会变慢。
- 质量信号被稀释:一个目录下堆积大量近似或空壳页面,会让搜索引擎对该目录的整体判断变得模糊。
- 排查变难:日志里蜘蛛路径被低价值 URL 占满,你想看的重点页面反而不容易发现。
- 站内链接结构变乱:筛选页互相链接,容易形成大面积的抓取路径。
收录数字是结果,不是目标。它只能说明蜘蛛愿意抓,不能说明页面值得留。
常见的几类膨胀来源
参数与筛选组合
电商、房产、招聘类站点最常见。颜色、尺码、排序方式、价格区间任意组合,会生成大量内容高度重复的 URL。
分页与日期归档
分页第二页之后的页面、按日期归档的页面,通常只在特定场景有价值,长期堆积就变成了体量。
标签页与聚合页
标签页如果只有一个列表、没有独立描述,和其他标签页之间差别很小,容易被当成近似页面。
空结果页与软 404
搜索无结果、商品已下架的页面,如果返回 200 且没有实质内容,也可能被索引。
怎么确认自己有没有膨胀
- 用 site: 加目录前缀抽样,看每个目录被收录的主要是哪类页面。
- 翻服务器日志,按路径前缀统计蜘蛛抓取量,再和该目录带来的自然流量做对比。
- 找出抓取量高、流量近乎为零的路径前缀,这类通常是重点嫌疑。
- 抽查这些页面的标题和正文,确认是否有独立内容。
处理顺序:先收口,再减入口
对确认没有价值的页面,一般按这个思路处理:
- 能规范的用 canonical 指向主版本,比如把筛选页指向对应分类主页面。
- 不需要出现在索引里的,用 noindex 明确表态。
- 完全不必要被抓的,再考虑 robots.txt 屏蔽。注意两者关系:屏蔽之后蜘蛛读不到页面上的 noindex,索引里的旧条目需要靠页面自然更新或删除来处理。
- 减少内链入口,特别是页脚、侧栏里批量输出的链接。
- 把这些 URL 从站点地图中剔除。
别一刀切
有些筛选页确实承接真实搜索需求,比如“某品牌加某型号”这类组合。判断标准是它有没有独立内容、有没有外部链接和自然流量,而不是它长得像参数页。把有需求的留下、把纯组合的收口,比整体屏蔽更稳妥。
收口之后看什么
处理完不要指望立刻见效,索引更新需要时间。先看日志里这些路径的抓取量是否下降,再看重点页面的抓取频次有没有回升。把收录总量拆成核心页面和长尾页面两部分来看,才不容易被一个总数误导。