打开索引覆盖报告,很多人第一反应是盯着“已排除”那串数字,想把它压到零。但“已排除”本身不是错误,它是一个混合了主动声明、系统判定和待处理项的桶。把它当成一张待办清单,很容易把时间花在根本不需要动的页面上。
先分清:状态是结论,不是原因
“已排除”里的每一条都对应一个判断结果,而同一个结果可能来自完全不同的原因。比如同样显示为“重复网页,未选定的规范网页”,可能是站内参数版本互撞,也可能是别的站点搬走了你的内容。处理方式完全不同,所以在动手之前,先点进具体条目,看清系统认定的“规范版本”是哪一个 URL。
常见几类“已排除”的读法
第一类:你自己主动声明的
- 已提交的 noindex:说明标记生效了,这是预期结果,不用处理。
- 通过重定向排除:旧 URL 被 301 到新地址,属于正常收敛。
- 备用网页(有适当规范标记):移动版或参数版被指向主版本,只要 canonical 是自己写的、指向正确,就可以放着。
这三类的共同点是:排除动作由你发起。它们出现在报告里,是系统确认收到了你的指令,而不是问题清单。
第二类:系统替你做的判断
- 重复网页,未选定的规范网页:系统选了一个它认为更合适的版本,可能是对的,也可能是错的。
- 已抓取,尚未编入索引与已发现,尚未抓取:这两个严格说不算“排除”,而是流程还没走完,更多和抓取配额、页面价值判断有关。
- 软 404:返回 200 但内容接近空页,是真正需要处理的信号。
- 抓取异常:服务器错误、超时、DNS 问题,属于技术侧问题,优先级最高。
处理顺序:先看影响面,再看数量
- 先处理抓取异常。它会让整批 URL 拿不到内容,其他问题都排在它后面。
- 再看软 404 和空白页,这类页面会稀释站点整体质量判断。
- 接着核对“未选定的规范网页”。重点看被选中的那个 URL 是不是你希望被收录的;如果不是,才需要改 canonical 或内链指向。
- 最后看已发现,尚未抓取的积压量。数量大且长期不动,通常说明内链入口太少,或者页面价值信号偏弱。
一个常见的误判
看到成百上千条“重复网页,未选定的规范网页”,就想着逐个改 canonical。实际上,如果系统选中的正是你的主版本,这些条目不需要任何动作。真正要关注的是被选错的那些:往往是参数拼写、大小写、末尾斜杠不同造成的同一内容多版本,把口径收敛一次就能解决一大片。
判断标准很简单:这条“已排除”是不是你主动要求的?是,就先不用管;不是,再看它挡住了哪一类页面,影响面有多大。
看报告前先确认口径
不同工具对“已排除”的统计范围并不一致:有的按已提交的 URL 算,有的按系统发现的所有 URL 算。对比数据时先确认分母是什么,否则数字对不上会浪费很多时间。同时报告本身有延迟,改动之后不要当天就下结论,给重抓和重新评估留出时间。
把“已排除”读成一份分类清单而不是错误列表,排查会轻松很多:先分主动和被动,再按影响面排序,一次只动一类问题,改完观察一段时间再动下一类。