网站收录

索引覆盖率里的“已排除”:先分清主动屏蔽、规范归并和技术问题

索引覆盖率报告里的“已排除”是一堆原因混在一起的统称。里面既有你自己设置的屏蔽,也有系统按规范做的归并,还有确实要修的错误。不先分类就动手,容易把正常状态当故障处理。

网站收录

索引覆盖率里的“已排除”:先分清主动屏蔽、规范归并和技术问题

打开索引覆盖率报告,很多人只盯着“有效”那一栏的数字,看到“已排除”下面一长串条目就紧张。其实“已排除”只是一个统称,里面混着三类性质完全不同的东西:你自己要求的排除、系统按规范做的归并、以及确实需要动手的技术问题。不先分类,就容易把正常状态当成故障来修。

先看清状态之间不是一回事

报告里常见的状态大致可以分成几档:

  • 已发现,尚未抓取:蜘蛛知道这个地址存在,还没排到队。
  • 已抓取,尚未编入索引:蜘蛛来过了,也读了内容,但系统暂时没把它放进索引。
  • 已排除:明确不放进索引,后面会跟着一条原因。

前两种严格来说不算“排除”,只是还没走完流程。真正要看原因说明的,是第三类。而第三类下面的条目,又得再分一次。

第一类:主动屏蔽,改不改看你的意图

这一类是你自己下的指令,常见的有:

  • robots.txt 里屏蔽了对应目录
  • 页面带了 noindex 标签或响应头
  • 内容需要登录或被权限拦截
  • 测试环境、内网地址被有意挡在外面

处理方式只有两种:如果这些页面本来就不该出现在搜索结果里,那它出现在“已排除”下是正确结果,不用管;如果现在需要被索引了,就把屏蔽撤掉,再让它重新被抓一次。这里的重点是先确认意图,再确认配置,不要看到排除字样就先把 robots 打开。

第二类:规范归并,通常不用处理

这一类是系统在多个地址之间做了选择,常见原因包括:

  • 备用网页,有规范标签指向别的地址
  • 重复网页,用户未选定规范版本
  • 重定向,或页面已被新地址替换

这类排除往往是设计中的结果,同一份内容本来也不该有多个地址同时进索引。真正需要核对的是另一件事:被选中、被指向的那个规范地址,自己能不能被抓取、有没有进索引。如果规范地址本身也进不去,那问题不在“被排除”的这些页面上,而在目标页。

第三类:技术问题,需要排顺序修

这一类才是要动手的,典型的表现是:

  • 404 与软 404:地址不存在,或者返回 200 但正文是空的
  • 服务器错误:5xx 导致的抓取失败
  • 抓取异常:连接超时、被防火墙拦截
  • 内容为空或占位文本

处理顺序上,先解决可访问性,再谈收录。一个地址如果连稳定返回正常内容都做不到,讨论它有没有被索引意义不大。

只盯着条目数量会走偏

“已排除”条目多,不等于站点出了问题。一个结构正常的电商或内容站,光是分页、筛选参数、标签页就能贡献大量正常的排除记录。反过来,条目少也不代表没问题,真正要命的情况往往是被排除的页面恰好是承载主要流量的那些。

比数量更有用的做法,是看排除原因的变化趋势:某一类原因突然增多,才值得去查最近改了什么。

一个可以照着走的核对顺序

  1. 把排除列表导出,按原因说明分组,而不是按页面分组。
  2. 先标出属于主动屏蔽的条目,逐个确认是否仍然需要屏蔽。
  3. 再看规范归并类的条目,抽查它们指向的规范地址是否可正常访问、是否在索引中。
  4. 剩下的按错误类型排序:5xx 优先,其次是软 404 和内容为空的页面,最后是普通 404。
  5. 修完之后留出一段时间再回看,不要一天改好几轮配置。
这一类问题的判断原则是:先判断这个地址该不该出现在索引里,再判断它为什么没进去。顺序颠倒,很容易白费力气。

索引覆盖率是一个观察工具,不是评分表。把“已排除”拆成上面这几类之后,你会发现大部分条目本来就不需要动作,真正要修的只有一小部分。