站点上线一段时间后,很多人会去看索引总量。偶尔会看到这样一个现象:明明只有几千个内容页,索引里却显示上万条地址。多出来的部分,大多来自筛选页、标签页、搜索结果页和各种参数组合。它们不是错误页面,抓取正常、返回 200,被收录本身也符合规则,但会让索引体积虚高,稀释站点整体的质量判断。这篇讲这类页面怎么识别、哪些该留、按什么顺序收敛。
索引膨胀的常见来源
- 列表页的筛选与排序参数:颜色、价格区间、排序方式、每页条数,两两组合就是成倍的地址。
- 标签页、话题页:自动生成的标签只挂一两篇内容,却和栏目页高度重复。
- 站内搜索结果页:关键词无穷,地址无穷,多数没有独立检索价值。
- 日历、作者、归档页:按年月或按作者平铺,内容与列表页几乎一致。
- 测试域名、旧域名、临时路径:改版或测试留下的可访问地址,被外部链接带进了索引。
- 分页过深:一个列表翻到几十页之后,内容价值很低却仍被逐个抓取。
判断标准其实很简单:这个地址被搜到的时候,用户会不会觉得它回答了问题。如果它只是同一批内容的另一种排列方式,多半不属于该进索引的那一类。
先确认,再动手
收敛之前先抽样看看。用 site: 指令加路径前缀,观察有多少条被收录、落在哪些模式上。再对照索引覆盖报告和服务器日志,看蜘蛛把抓取量花在了哪类地址上。很多站点的问题不是页面被收录,而是抓取配额被这些组合地址吃掉,真正需要及时更新的内容页反而排到了后面。
同时要区分两件事:抓取和收录不是一回事。一个地址被抓取过,不代表它会留在索引里;反过来,想让它退出索引,也不能只靠 robots.txt 屏蔽抓取——被拦住的页面,meta noindex 也就读不到了。
按这个顺序收敛
- 先看需求。有真实搜索需求的筛选组合(比如品牌加型号、地区加品类)可以保留,甚至单独优化;纯排列组合、没有独立检索价值的,优先处理。
- 再改内链。减少指向筛选组合、日历页、标签页的入口,让蜘蛛自然少发现这些地址。内链是最温和也最有效的手段,改动成本低,也不影响已收录页面的正常访问。
- 需要退出索引的,页面保持可抓取,加 meta noindex,并确认渲染后的 HTML 里能读到它。批量处理时按路径前缀分几批,方便回查。
- 参数类地址优先用 canonical 指向无参数的主地址,同一批内容只保留一个规范版本,避免同内容多地址并存。
- 确定长期不存在的地址,用 410 或 301;不要用 302 长期挂着,也不要让 404 页面返回 200。
- 处理完更新站点地图,只提交真正希望被索引的地址,别把筛选组合塞进去。
不要一刀切
把所有筛选页和标签页统统屏蔽,是常见的过头做法。有些标签页本身就是不错的聚合入口,流量和转化都在;有些筛选组合词有稳定搜索量。判断依据应该是数据和内容质量,而不是页面类型。可以分三步走:先保留,观察搜索表现;表现差的逐步收敛;完全没有曝光和点击的,再统一清理。
索引数量本身不是指标。真正值得关注的是:进入索引的地址里,有多少能拿到曝光和点击。
收敛后要复查
- 索引报告里目标路径的数量是否下降,下降通常是渐进的,需要几周。
- 在验证工具里抽查几个样板地址,确认 noindex 或 canonical 被正确识别。
- 看抓取统计,确认蜘蛛把更多配额分给了内容页。
- 确认重要页面的收录没有被误伤,尤其是保留的标签聚合页和栏目页。
最后提醒一点:收敛的目标是让索引更贴近站点真实的内容结构,不是把数字压低。如果数字降下来、重要页面的曝光也跟着掉了,说明处理范围划错了,需要回退。