收录数字往上走,很多时候并不代表站点在变好。当索引里塞进大量低价值 URL,真正重要的页面反而可能排不上队去抓取和评估,这就是常说的索引膨胀。它不会立刻带来惩罚,但会慢慢消耗站点的抓取预算,也让后续的收录判断变得模糊。
先把“收录多”和“收录好”分开
site 查询看到一个很大的数字,第一反应如果是“还行”,就容易漏掉问题。索引里的 URL 数量只是一个口径,它不区分页面重要程度。一个只有几十页核心内容的站点,索引里躺着几千条参数 URL,本质上不是资产,而是负担。
这里还要重复一个容易混的点:被抓取不等于被索引,被索引也不等于有展示。收敛的目标不是把数字压到某个阈值,而是让索引里留下的 URL,尽量都是你愿意让人看到的那一批。
索引膨胀常见的几个来源
- 筛选、排序、价格区间等参数组合生成的 URL,尤其是可以无限翻页的那种。
- 分页列表的第 N 页,页码越深,内容重复度越高,单独看几乎没有价值。
- 标签页、作者页、日期归档页,单页内容单薄,但数量可以轻易过千。
- 站内搜索结果页被内链或外链放出来之后,被蜘蛛顺着抓走。
- 测试域名、旧版本目录、www 与非 www、http 与 https 的变体没有做归一。
- 大小写、结尾斜杠、session id 等同一页面的多种写法各自进了一份索引。
怎么确认自己是不是已经膨胀了
不用把全站都翻一遍,抽样就够了。从索引里随手抽 50 到 100 条 URL,逐条问一句:这个页面如果出现在搜索结果里,我会不会觉得尴尬?如果尴尬的比例超过两三成,基本可以确认有膨胀。
- 看服务器日志,蜘蛛大部分时间抓的是不是参数页和归档页。
- 看索引状态分布,是否有大量页面停在“已抓取,尚未编入索引”。
- 把 sitemap 里的 URL 和索引里的 URL 做一次对比,看差集长什么样。
- 看内链,低价值 URL 是不是从导航、侧栏、正文里被大量引用。
收敛的顺序:先堵源头,再谈移除
- 先堵源头。内链、sitemap、对外投放的链接,不要再指向低价值 URL。源头不断,后面清多少都会长回来。
- 再统一规范。能归一的用 301 归一,同一份内容的多种写法用 canonical 指向主版本,参数规则在服务端或 CDN 层做统一处理。
- 控制抓取。确实不需要被访问的路径,可以用 robots.txt 屏蔽。但要留意,被屏蔽的页面蜘蛛看不到页内指令,所以别指望用 noindex 去配合它。
- 明确移除。确定要下线的页面返回 404 或 410;还需要保留但不该进索引的,用 noindex。整批处理比零散处理更容易观察效果。
- 持续观察。索引更新是分阶段的,给它几周到几个月,看日志里核心页的抓取频次有没有上来。
几个容易踩的坑
- robots 屏蔽和 noindex 混用,结果两边都不生效。
- canonical 指向了一个 404 或重定向链上的地址,等于没指。
- 为了压数字一刀切,把本来还有搜索需求的辅助页一起误伤。
- 把收录数当成唯一 KPI,忽略了核心页的抓取频次和展现变化。
收敛之后,收录数下降是正常的
清理完一段时间内,site 查询的数字大概率会掉,甚至掉得有点多。这不一定是坏事。抓取预算被释放出来之后,核心页面的重抓间隔通常会缩短,日志里能明显看到变化。真正要盯的是核心页的索引状态、展现量和点击,而不是那个总数。
收敛是个慢过程,规则定清楚、执行保持一致,比追求短期数字变化更重要。任何一方都无法保证具体的处理时间或最终结果。