site: 的数字变大,很多人第一反应是收录变好了。但如果索引里的 URL 数量远多于站点真正想让人搜到的页面,这更可能是索引膨胀:大量低价值、重复或临时的地址被搜索引擎保存了下来。它带来的直接结果是抓取额度被分散,重要页面更新更慢,索引里还掺杂着过期或残缺的版本。
判断是否膨胀,不看绝对数字,而看比例。把索引中的 URL 按模式归类,看有多少落在你认可的“有效页面”范围内。如果有效页面只占很小一部分,就值得处理。
膨胀通常从哪来
自动生成、数量近乎无限的地址
- 筛选与排序参数:颜色、价格区间、排序方式组合出的地址。
- 站内搜索结果页:一次搜索就是一个地址,数量几乎无上限。
- 日历与日期归档页:按天生成的空页面。
- 标签、作者、分类的深层组合页。
内容极薄的页面
只有标题和一句摘要的详情页、没有正文的活动页、模板未填满的落地页,本身价值有限,却因为站内到处有链接而被反复抓取。
会话与跟踪参数
带 session id、来源跟踪参数的地址,会为同一个页面生成大量副本。
先归类,再动手
收敛之前要先有清单,否则容易误伤。
- 从服务器日志或索引抽样中收集一批 URL。
- 按可识别的模式分组:有无参数、路径前缀、是否搜索页。
- 给每组标注:是否有效页面、是否有独立搜索需求、是否有真实访问。
- 对没有价值的组,逐组确定处理方式。
处理的顺序很关键
最常见的错误是一上来就用 robots.txt 挡住一批目录,结果这些页面仍留在索引里,因为搜索引擎看不到页面上的 noindex。
- 已经收录、又不想要的页面:优先用 noindex,让抓取继续进行,等它读到标签后再退出索引。
- 从未收录、也不想被抓的低价值路径:用 robots.txt 阻止抓取,避免继续占用抓取额度。
- 只是重复但页面本身有价值:用 canonical 指向主版本,并保证主版本自身可访问、可被抓取。
- 减少入口:撤掉内链、导航和 sitemap 里的相关地址,让它们不再被持续发现。
处理信号需要时间。改完就反复检查、再叠加一层限制,往往会把问题弄复杂。
收敛之后看什么
不要只盯收录总量。更有意义的观察对象是:有效页面的抓取频次是否上升、新页面被发现的速度是否变快、索引中是否还残留明显无价值的地址。索引更新有滞后,通常按周观察,而不是按天。
如果一段时间后低价值地址减少,而核心页面的抓取与更新表现变好,说明方向对了。反过来,如果有效页面也开始掉出索引,要检查是否限制范围过宽,比如整站目录被挡住,或者 canonical 指向了不该指向的地址。