网站收录

索引膨胀:那些不该被收录的页面是怎么进来的

同一份内容因为参数、排序、筛选的差异被拆成很多个 URL,是索引膨胀最常见的来源。它会分走抓取机会、稀释页面质量判断。本文讲怎么识别这些多余的 URL、robots.txt 和 noindex 的区别,以及收口时的处理顺序和观察周期。

网站收录

索引膨胀:那些不该被收录的页面是怎么进来的

索引膨胀说的是什么

索引膨胀指的是:站点里被搜索引擎收录的 URL 数量,远远超过真正有价值的内容页数量。多出来的部分通常不是外链造成的,而是站点自己批量生成的——同一份内容因为参数、排序、筛选、会话标识的差异,被当成很多个页面放进了索引。它一般不会直接带来惩罚,但会持续稀释抓取机会和质量判断。

常见的几个来源

  • 筛选与排序参数:颜色、价格区间、排序方式组合出的 URL,页面正文差异极小。
  • 站内搜索结果页:以搜索词参数结尾的 URL 可以被无限构造,且大多没有独立价值。
  • 会话与追踪参数:utm、sessionid、ref 这类参数不应该出现在被索引的 URL 里。
  • 日历页、空列表页、无结果页:由模板自动生成,可访问但内容极薄。
  • 浅层分页:要不要收,得看翻页后是否还有可读内容,不必一刀切。

为什么它拖慢的是收录

抓取机会被分走

搜索引擎每天愿意花在一个站点上的抓取资源是有限的。当大量参数页、空页占据抓取队列,新发布的内容页和真正需要更新的页面就要排在后面,被发现和被重新抓取的时间都会往后推。

同站页面互相竞争

多个 URL 承载几乎相同的内容时,搜索引擎需要自己判断哪一个是主版本。判断结果不稳定,就会出现同一批关键词下入口来回切换、页面表现起伏的情况。这既影响观察,也影响运营判断。

先判断,再动手

  1. 用 site: 抽样看看索引里都是哪几类 URL,注意这个数字是估算值,看类型分布比看总量更有意义。
  2. 查服务器日志,统计被抓取次数最多的 URL 属于哪一类,很多问题在日志里比在报告里更早暴露。
  3. 把索引报告里的“已发现但未抓取”和“已抓取但未索引”分开看,前者多说明抓取入口有问题,后者多说明内容判断有问题。

收口时的两个常见坑

robots.txt 和 noindex 不是一回事。robots.txt 是禁止抓取,搜索引擎拿不到页面内容,自然也读不到页面上的 noindex;对一个已经被收录的 URL,只加 robots.txt 通常不会让它退出索引。更稳妥的顺序是:先允许抓取,再让页面返回 noindex;对确实下线的页面,直接返回 410 或 404 也是明确信号。canonical 可以用于合并,但前提是页面之间确实是同一内容的不同展现,否则容易被忽略。

一个简单的判断标准:如果这个 URL 单独被用户打开时,内容不值得保存或分享,它大概率也不值得长期占用索引位置。

一个可执行的顺序

  1. 先处理追踪参数和会话参数,这类基本是纯噪音,改动风险也最低。
  2. 再收敛筛选、排序和搜索页,按页面类型统一处理,而不是逐条改。
  3. 把 sitemap 换成只包含规范 URL 的版本,别把它当成收录清单来用。
  4. 内链只指向规范版本,减少蜘蛛顺着站内链接发现副本的路径。
  5. 上线后持续观察几周,同时看索引数量与抓取分布的变化。

预期管理

索引数量下降是正常的,很多时候还是好事:留下的页面能获得更集中的抓取和评估。这类调整通常以周为单位见效,不是改完第二天就能看到结果。真正值得关注的不是索引总量这个数字,而是有价值的页面是否更容易被抓取、被收录,并且稳定地留在索引里。