打开搜索后台的索引覆盖报告,大多数人第一反应是看“已编入索引”那一栏有多少,然后被旁边一堆“已排除”吓一跳。实际上,“已排除”只是一个分类标签,它既包含你主动要求不要收录的 URL,也包含搜索引擎自己判断不值得收录的 URL。把这两者混在一起看,很容易做出错误改动。
一、“已排除”里哪些是符合预期的
下面这些状态通常说明系统按你的意图或按常规逻辑处理了页面,不需要额外动作:
- noindex 标记生效:页面明确要求不进索引,被排除是正确结果。
- robots.txt 屏蔽:注意屏蔽的是抓取,不是索引;如果页面已经被收录,屏蔽反而可能让它以无摘要形式留在结果里。
- canonical 指向其他 URL:同一份内容的多个版本,系统把权重归到你指定的那一版。
- 重复网页,系统选择了别的规范页:这表示你的 canonical 与系统看到的信号不一致,属于需要看一眼的状态,但不代表页面本身有问题。
- 替代页面:移动版、AMP 版、打印版等,主版本被收录即可。
- 重定向与备用网页(有规范标记):旧 URL 的常见归宿。
二、容易误判的几个状态
已发现但尚未抓取
这不属于“排除”,只是排队。它说明 URL 已经被知道,但抓取资源还没轮到。判断依据是看进入这个状态的时间和站点整体抓取量,而不是单看数量。
已抓取但尚未编入索引
页面已经拿回来了,系统在犹豫要不要放进索引。常见原因是内容与站内其他页高度相似、信息量偏薄、页面缺少明确主题,或者站点整体可索引的 URL 太多而价值参差。这个状态最需要看页面本身,而不是去改 robots 或提交更多 URL。
软 404
返回 200,但内容看起来像空页、占位页或错误提示。系统据此判断页面没有实质内容。核对方式是看页面在无参数、无登录状态下返回的正文是否完整。
重复网页,用户选择的规范网页与系统选择的不同
这是最值得看的一条。它说明页面上的 canonical、内链、站点地图、历史收录之间存在冲突,系统选了另一边。要么把信号统一,要么接受系统的选择。
三、建议的核对顺序
- 先看 URL 自身:返回码是否稳定为 200,是否有 noindex,canonical 指向哪里。
- 再看 robots.txt 与抓取情况:是不是被拦住了,蜘蛛是否真的来过。
- 然后看重复版本:同内容有几个 URL,系统选中的是哪一个,和你预期是否一致。
- 接着看页面质量:正文是否完整、是否与站内其他页大量雷同、有没有明确主题。
- 最后看入口:内链是否可达、站点地图是否包含、有没有其他页面指向它。
- 改完不要立刻下结论,至少观察一到两个更新周期,再看同一批 URL 的状态变化。
四、处理优先级:不是每个“已排除”都要动手
符合预期的排除项放着就好,逐条去“修”只会浪费时间,还可能把原本正常的页面改成冲突状态。真正需要处理的是三类:本该被收录却长期停在“已抓取但未编入索引”、canonical 信号与系统选择长期打架、以及返回码或内容异常的软 404。
判断标准很简单:这个 URL 是否值得出现在搜索结果里,且当前状态与这个目标不一致。两者都成立,才叫问题。
五、看趋势,不看单日快照
索引报告本身有延迟,样本也在滚动。同一批 URL 今天在“已排除”,几天后可能自己变回“已编入索引”。更稳妥的做法是固定一批 URL 做长期跟踪,记录状态变化的时间点,再对照期间做过的改动。这样得到的结论,比盯着某一栏的数字波动可靠得多。
把“已排除”当成一个需要分类的问题,而不是一个统一的坏消息,能省下大量无效操作。分类清楚之后,绝大多数状态其实不需要处理。