打开索引覆盖率报告,很多人只盯着“有效”那一栏的数字,看到“已排除”下面一长串条目就紧张。其实“已排除”只是一个统称,里面混着三类性质完全不同的东西:你自己要求的排除、系统按规范做的归并、以及确实需要动手的技术问题。不先分类,就容易把正常状态当成故障来修。
先看清状态之间不是一回事
报告里常见的状态大致可以分成几档:
- 已发现,尚未抓取:蜘蛛知道这个地址存在,还没排到队。
- 已抓取,尚未编入索引:蜘蛛来过了,也读了内容,但系统暂时没把它放进索引。
- 已排除:明确不放进索引,后面会跟着一条原因。
前两种严格来说不算“排除”,只是还没走完流程。真正要看原因说明的,是第三类。而第三类下面的条目,又得再分一次。
第一类:主动屏蔽,改不改看你的意图
这一类是你自己下的指令,常见的有:
- robots.txt 里屏蔽了对应目录
- 页面带了 noindex 标签或响应头
- 内容需要登录或被权限拦截
- 测试环境、内网地址被有意挡在外面
处理方式只有两种:如果这些页面本来就不该出现在搜索结果里,那它出现在“已排除”下是正确结果,不用管;如果现在需要被索引了,就把屏蔽撤掉,再让它重新被抓一次。这里的重点是先确认意图,再确认配置,不要看到排除字样就先把 robots 打开。
第二类:规范归并,通常不用处理
这一类是系统在多个地址之间做了选择,常见原因包括:
- 备用网页,有规范标签指向别的地址
- 重复网页,用户未选定规范版本
- 重定向,或页面已被新地址替换
这类排除往往是设计中的结果,同一份内容本来也不该有多个地址同时进索引。真正需要核对的是另一件事:被选中、被指向的那个规范地址,自己能不能被抓取、有没有进索引。如果规范地址本身也进不去,那问题不在“被排除”的这些页面上,而在目标页。
第三类:技术问题,需要排顺序修
这一类才是要动手的,典型的表现是:
- 404 与软 404:地址不存在,或者返回 200 但正文是空的
- 服务器错误:5xx 导致的抓取失败
- 抓取异常:连接超时、被防火墙拦截
- 内容为空或占位文本
处理顺序上,先解决可访问性,再谈收录。一个地址如果连稳定返回正常内容都做不到,讨论它有没有被索引意义不大。
只盯着条目数量会走偏
“已排除”条目多,不等于站点出了问题。一个结构正常的电商或内容站,光是分页、筛选参数、标签页就能贡献大量正常的排除记录。反过来,条目少也不代表没问题,真正要命的情况往往是被排除的页面恰好是承载主要流量的那些。
比数量更有用的做法,是看排除原因的变化趋势:某一类原因突然增多,才值得去查最近改了什么。
一个可以照着走的核对顺序
- 把排除列表导出,按原因说明分组,而不是按页面分组。
- 先标出属于主动屏蔽的条目,逐个确认是否仍然需要屏蔽。
- 再看规范归并类的条目,抽查它们指向的规范地址是否可正常访问、是否在索引中。
- 剩下的按错误类型排序:5xx 优先,其次是软 404 和内容为空的页面,最后是普通 404。
- 修完之后留出一段时间再回看,不要一天改好几轮配置。
这一类问题的判断原则是:先判断这个地址该不该出现在索引里,再判断它为什么没进去。顺序颠倒,很容易白费力气。
索引覆盖率是一个观察工具,不是评分表。把“已排除”拆成上面这几类之后,你会发现大部分条目本来就不需要动作,真正要修的只有一小部分。