网站收录

索引量比预期多出一截:先排查这几类“顺手被收录”的页面

索引页面数量超过预期,往往不是算法波动,而是站内一批模板生成的 URL 被顺手收了进去。本文按“先归类、再判断价值、最后选手段”的顺序,梳理站内搜索页、筛选组合页、标签归档页等常见来源,并说明 canonical、noindex 与抓取层屏蔽各自适合处理什么情况。

网站收录

索引量比预期多出一截:先排查这几类“顺手被收录”的页面

做站点运营时,经常会遇到一种情况:明明只发了几十篇内容,索引里的页面数量却多出好几倍。多数时候这不是算法在乱收,而是站内一批由模板自动生成的 URL 被顺手抓走并编入了索引。要处理它,先别急着批量关掉,而是把“为什么会被收录”和“该不该被收录”分开看。

一、先分清“收录多了”是哪一种多

索引数量上涨本身没有好坏,关键是涨的是什么。大致可以分成三类:一是有效新增,比如新开的栏目、新发布的文章;二是同类页面批量进入,比如筛选组合、分页、标签页;三是本不该出现的 URL 进入,比如带会话参数、站内搜索结果页、打印页。抽三十到五十个样本 URL 归一下类,通常很快就能看出是哪一类在占量。

二、容易被顺手收录的几类页面

  • 站内搜索结果页:用户搜什么就能生成什么,URL 数量几乎无上限。
  • 筛选与排序组合页:颜色、价格、排序方式叠加,很容易组合爆炸。
  • 标签页、作者页、日期归档页:内容条数少的时候,和主列表高度重复。
  • 分页第二页及之后:是否值得单独进入索引,要按内容量判断。
  • 打印页、附件页、纯文件下载页:有独立价值才留。
  • 带跟踪码或会话 ID 的 URL 变体:同一页面出现多个版本。

这些页面的共同点是:能正常打开、返回 200,内容也不算空白,所以被抓到之后很容易被当作正常页面处理。

三、处理顺序:先判断价值,再决定手段

价值判断在前,手段选择在后,顺序反了容易误伤。可以按下面几步走:

  1. 这个页面有没有独立的搜索价值?会不会有人直接搜它、点进来?
  2. 如果有,就保留,同时确认它能从站内正常点到达。
  3. 如果和主页面内容高度重复,优先考虑合并,并用 canonical 指向主版本。
  4. 如果确实没有搜索价值,用 noindex 处理,而不是用 robots.txt 屏蔽。
  5. 如果它连被发现的必要都没有,比如会话参数、站内搜索,才考虑在抓取层挡住。

这里要留一个心:canonical 是提示而不是强制指令,noindex 也需要页面能被抓到才能读到。用 robots.txt 挡住抓取,反过来会让搜索引擎看不到页面上的 noindex,两件事不要混用。

四、不要一次性全部关掉

处理这类问题最常见的翻车方式,是看到数量多就批量加上 noindex。比较稳妥的做法是先小范围试,挑一类页面处理,观察一到两个抓取周期,确认没有影响到正常页面的抓取和收录,再扩大范围。

另外,列表页不要默认当成垃圾页。有些分类列表本身就有人搜,也有稳定的流量,关掉之后可能会出现内容页收录变慢的情况,因为内链入口少了一条。

五、收敛之后还有几件事要做

  • 检查内链,确认没有大量链接还指向已经决定不收录的 URL。
  • 检查 sitemap,别把 noindex 的页面继续提交上去,两个信号会互相打架。
  • 新模板上线前就把控制规则想好,比如筛选参数超过两个就不生成可抓取的链接。
  • 隔一段时间重新抽样看一遍,模板改版后往往会冒出新的组合 URL。

六、几个常见的理解偏差

索引量下降不等于流量下降,同样,索引量上涨也不等于内容变多。两个数字要放到一起看,而不是只看其中一个。

  • 把“被收录”当成对页面的肯定,其实它更多说明页面被抓到、且没有明确的排除信号。
  • 把分页页一刀切处理,忽略有些分页确实承载了独立内容。
  • 只在收录出问题时才想起规范 URL,平时发布时不做控制。

索引量超出预期,多半是入口设计的问题,而不是内容的问题。把来源归类清楚,按价值高低分先后处理,通常不需要大动作,数量就能慢慢回到合理区间。