索引量突然涨了一截,很多时候不是内容变多了,而是有一批本来不该进索引的页面被收录了。这种“虚高”不会带来流量,反而会占用抓取额度、分散站内链接的传递方向,让真正想被搜到的页面排队更久。与其盯着数字焦虑,不如先弄清楚多出来的到底是哪些地址。
先把多出来的部分归归类
用索引报告、抓取日志或站内 URL 清单,把新增的部分按目录和参数结构分组。常见的几类大致是:
- 站内搜索结果页,以及筛选、排序的组合地址;
- 标签、专题、作者等聚合页的空结果版本和翻页版本;
- 打印页、手机版、旧模板留下的历史地址;
- 附件、缩略图、接口返回的 JSON、XML 或纯文本;
- 测试目录、临时路径、调试参数被外部链接带进来的地址。
归完类通常会发现问题并不复杂:它们大多不是独立内容,而是同一批内容的不同入口,或者同一批数据的另一个壳子。
判断标准:这个页面能不能独立回答一个问题
分类之后需要一个取舍标准,否则容易一刀切。比较实用的问法是:把模板、导航、推荐位全部去掉之后,这个地址上还剩什么?
如果剩下的是一段完整的正文、一组有整理逻辑的条目,或者能独立回答某个具体问题,那它值得保留;如果剩下的是零散字段、空结果提示、和别人完全一样的摘要,那它更接近工具页或入口页,本身不该占用索引位置。
还要注意一点:聚合页不是天生低质。带编辑说明的分类页、有新旧排序逻辑的专题页,很多时候是有搜索需求的;真正该收的是机械生成、内容重复、没有人工取舍的那一批。判断时按列表逐条看,不要按目录整个砍掉。
收口的顺序:先断入口,再改状态
顺序错了会白忙一场。建议按下面几步走:
- 先停住入口。检查内链、面包屑、分页组件、站点地图里有没有指向这些地址的链接,先把不该放的入口去掉,减少新地址被发现的可能。
- 再处理被发现但没价值的地址。能合并的用规范化指向主版本,确认不再需要的用 robots 规则阻止抓取,注意 robots 只是挡住抓取,不等于立刻从索引里删除。
- 对确实要下线的页面用合适的状态。永久不再提供的返回 404,整体迁移的用 301,只是不希望被索引但页面仍要服务用户的,用 noindex 并保证页面本身可访问。
- 最后核对站点地图与提交入口。把已经收口的地址从地图里清掉,避免一边屏蔽一边提交。
每一步之间留几天观察,抓取日志里这些地址的访问量下降,说明入口这部分起作用了。
索引清理本来就是慢活,设置改对之后按周看趋势就够了,不需要每天刷新数字给自己添压力。
几个容易做过头的地方
- 把整个栏目一刀切 noindex,连带砍掉本来有搜索需求的页面;
- 屏蔽了抓取又指望索引立刻消失,忽略了移除需要时间;
- 只改 robots 不改内链,站内还在持续产生新的同类型地址;
- 反复调整规则,导致同一批地址一会儿放开一会儿屏蔽,反而让抓取调度变得更乱。
把多出来的页面看成一件事来处理,而不是一堆需要消灭的数字,取舍会清晰很多。分类、判断、按顺序收口,再给足够的时间观察,索引结构自然会回到更接近真实内容规模的状态。