做站点运营时,经常会遇到一种情况:明明只发了几十篇内容,索引里的页面数量却多出好几倍。多数时候这不是算法在乱收,而是站内一批由模板自动生成的 URL 被顺手抓走并编入了索引。要处理它,先别急着批量关掉,而是把“为什么会被收录”和“该不该被收录”分开看。
一、先分清“收录多了”是哪一种多
索引数量上涨本身没有好坏,关键是涨的是什么。大致可以分成三类:一是有效新增,比如新开的栏目、新发布的文章;二是同类页面批量进入,比如筛选组合、分页、标签页;三是本不该出现的 URL 进入,比如带会话参数、站内搜索结果页、打印页。抽三十到五十个样本 URL 归一下类,通常很快就能看出是哪一类在占量。
二、容易被顺手收录的几类页面
- 站内搜索结果页:用户搜什么就能生成什么,URL 数量几乎无上限。
- 筛选与排序组合页:颜色、价格、排序方式叠加,很容易组合爆炸。
- 标签页、作者页、日期归档页:内容条数少的时候,和主列表高度重复。
- 分页第二页及之后:是否值得单独进入索引,要按内容量判断。
- 打印页、附件页、纯文件下载页:有独立价值才留。
- 带跟踪码或会话 ID 的 URL 变体:同一页面出现多个版本。
这些页面的共同点是:能正常打开、返回 200,内容也不算空白,所以被抓到之后很容易被当作正常页面处理。
三、处理顺序:先判断价值,再决定手段
价值判断在前,手段选择在后,顺序反了容易误伤。可以按下面几步走:
- 这个页面有没有独立的搜索价值?会不会有人直接搜它、点进来?
- 如果有,就保留,同时确认它能从站内正常点到达。
- 如果和主页面内容高度重复,优先考虑合并,并用 canonical 指向主版本。
- 如果确实没有搜索价值,用 noindex 处理,而不是用 robots.txt 屏蔽。
- 如果它连被发现的必要都没有,比如会话参数、站内搜索,才考虑在抓取层挡住。
这里要留一个心:canonical 是提示而不是强制指令,noindex 也需要页面能被抓到才能读到。用 robots.txt 挡住抓取,反过来会让搜索引擎看不到页面上的 noindex,两件事不要混用。
四、不要一次性全部关掉
处理这类问题最常见的翻车方式,是看到数量多就批量加上 noindex。比较稳妥的做法是先小范围试,挑一类页面处理,观察一到两个抓取周期,确认没有影响到正常页面的抓取和收录,再扩大范围。
另外,列表页不要默认当成垃圾页。有些分类列表本身就有人搜,也有稳定的流量,关掉之后可能会出现内容页收录变慢的情况,因为内链入口少了一条。
五、收敛之后还有几件事要做
- 检查内链,确认没有大量链接还指向已经决定不收录的 URL。
- 检查 sitemap,别把 noindex 的页面继续提交上去,两个信号会互相打架。
- 新模板上线前就把控制规则想好,比如筛选参数超过两个就不生成可抓取的链接。
- 隔一段时间重新抽样看一遍,模板改版后往往会冒出新的组合 URL。
六、几个常见的理解偏差
索引量下降不等于流量下降,同样,索引量上涨也不等于内容变多。两个数字要放到一起看,而不是只看其中一个。
- 把“被收录”当成对页面的肯定,其实它更多说明页面被抓到、且没有明确的排除信号。
- 把分页页一刀切处理,忽略有些分页确实承载了独立内容。
- 只在收录出问题时才想起规范 URL,平时发布时不做控制。
索引量超出预期,多半是入口设计的问题,而不是内容的问题。把来源归类清楚,按价值高低分先后处理,通常不需要大动作,数量就能慢慢回到合理区间。