收录量从几百涨到几千,搜索流量却几乎没动,这种情况在中小站点里并不少见。第一反应往往是「收录没生效」,但更常见的原因是:新增的那部分 URL 本来就不该被索引,它们进了索引池,却没有对应的搜索需求。
收录数量不是成绩单
收录只说明蜘蛛抓到了页面、系统认为它值得存进索引候选。之后还要经过质量评估、内容去重、与查询的匹配,才可能出现在结果里。一个页面被收录,和它能带来流量,是两件事。所以收录量上涨却看不到流量变化并不矛盾,它更可能是在提示你:索引里有相当一部分页面是被「顺带」收进去的。
索引膨胀通常来自这几类页面
- 带筛选、排序、分页参数的列表页,同一批内容被拆成几十上百个地址;
- 站内搜索结果页,内容由用户输入决定,几乎不可能有稳定的搜索需求;
- 标签页、聚合页,条目很少时页面主体只剩模板和几条链接;
- 同一内容的不同版本:打印版、移动版、多域名或多协议版本;
- 空列表、缺货、无结果的兜底页,被批量生成且没有真正的信息。
这些页面单独看都不算问题,但数量一多,就会稀释蜘蛛在你站上的时间,也让真正有价值的页面更难被稳定发现。
怎么判断是膨胀,而不是正常增长
- 抽样看被收录的低价值 URL:随机挑二十个,看它们有没有带来过展示或点击。全是零展示,就值得警惕。
- 看收录与展示的趋势是否同步:如果收录翻倍、展示基本持平,说明新增部分没有被搜索需求接住。
- 看抓取日志的分布:蜘蛛请求里参数页、搜索结果页占比过高,说明抓取资源被消耗在不产流量的地方。
- 看这些页面有没有稳定的内链入口:只存在于 sitemap、全站没有任何链接指向的 URL,多半是自动生成的副产品。
处理的顺序:先止血,再清理
- 先定位来源。用站点地图、抓取日志或收录查询,把同类 URL 按模板归组,找出是哪套规则在批量产出。
- 能合并的合并。同一组内容只在一条规范 URL 上呈现,其余用 canonical 指向它,或者不再对外暴露链接。
- 不能合并、又没有独立搜索价值的,用 noindex 挡在索引之外。注意是挡索引,不是挡抓取,否则蜘蛛看不到这条指令。
- 清理内链。导航、相关推荐、面包屑里不要再指向这些地址,否则它们会被反复发现。
- 观察一到两个抓取周期再下结论。抓取与失效都有延迟,改完立刻看数字容易误判。
几个容易踩的坑
- 一刀切给所有筛选页加 noindex,可能把有真实搜索需求的组合页一起挡掉,反而损失流量;
- 把大量低质 URL 塞进 sitemap,等于主动把噪声送到蜘蛛面前;
- 先用 robots.txt 屏蔽,页面上的 noindex 就永远读不到,索引里的旧记录会长期挂着;
- 只看总数不看结构。收录降了但留下来的都是有效页面,这未必是坏事。
收录量是过程指标,不是结果指标。与其盯着数字涨没涨,不如问一句:新增的这些 URL,各自对应哪一个真实存在的搜索需求。