网站收录

索引覆盖率报告怎么读:已收录、已排除与重复三类状态的核对顺序

索引覆盖率报告的价值不在总数涨跌,而在于它把站内 URL 分成了几类状态。本文说明已收录、已排除、重复网页等类别分别代表什么,以及核对时应按什么顺序看:先归类、再看共同特征、抽样确认原因,最后按特征批量处理,避免把待定状态误判成惩罚。

网站收录

索引覆盖率报告怎么读:已收录、已排除与重复三类状态的核对顺序

打开搜索后台的索引覆盖率报告,第一反应往往是看总数涨了还是跌了。但这个报告真正的价值不在总数,而在于它把站内 URL 分成了几类状态。同一批页面被分到不同类别里,处理方式完全不同,混在一起看只会越看越乱。

先看清报告里的几类状态

不同后台的叫法略有差异,但大体可以归成三组:

  • 已收录:页面被抓取且进入索引,至少具备被搜到的条件。
  • 已排除:系统知道这个 URL 存在,但有理由不把它放进索引。
  • 异常与错误:抓取层面就出问题了,比如服务器错误、重定向异常、被 robots.txt 拦下。

其中「已排除」里的原因最多,性质差别也最大,需要再往下拆一层。

已排除里最常见的几类及含义

已发现,尚未抓取

系统知道 URL,但还没排上抓取队列。这通常和抓取预算、站点响应速度、URL 总量有关,属于抓取环节的问题,不是质量判定。数量长期不降,才需要回头核对服务器响应和站内入口结构。

已抓取,尚未编入索引

页面已经被抓到了,但系统暂时没有把它放进索引。这一类最容易被误读成「被惩罚」。实际上它更像一个待定状态:内容是否足够独立、是否和站内其他页面高度相似、页面主题是否清晰,都会影响后续判断。要做的是核对这批 URL 的页面质量与重复情况,而不是反复提交。

重复网页,系统选择了其他规范页

说明系统认为这个 URL 和另一个 URL 内容相近,并把另一个当成了主版本。此时要核对两件事:一是 canonical 是否指向了正确的版本;二是这两个页面是不是真的应该同时存在。如果其中一个本来就该合并,要处理的是内容,不是标签。

已被 noindex 或 robots.txt 屏蔽

这类是人为设置的排除,属于预期结果。核对时只需确认:被屏蔽的 URL 是不是你确实不想收录的那批。如果误伤,改回来即可。

核对顺序:从量大的类别开始

  1. 先看哪一类占比最大。占比最大的那类,决定了这一轮要解决的主要问题。
  2. 再看这些 URL 有没有共同特征:是否集中在某个栏目、某种参数、某个模板。
  3. 抽样几条,确认实际原因和类别描述是否一致。类别描述只是系统的判断,真实原因要回去看页面。
  4. 按特征批量处理,处理完观察一到两周,再看比例变化。

逐条查单个 URL 效率很低,而且很容易把模板层面的问题当成偶发问题。

几个常见的误判

  • 把「已抓取未编入索引」当成永久拒绝。它是动态状态,会随内容和站内结构调整而变化。
  • 把「已排除」等同于「出问题了」。大量已排除是正常的,比如分页、筛选参数、后台页面。
  • 用提交量冲抵收录量。提交只影响发现速度,不解决页面本身的判断问题。
  • 只看总数不看分类。总数下跌有时只是把一批重复 URL 清理掉了,未必是坏事。
索引覆盖率是一张分类表,不是一张成绩单。先归类,再决定要不要动手。

什么时候该动,什么时候该等

如果某一类里绝大多数 URL 都是你本来就不想收录的,那什么都不用做。如果某类里集中了核心内容页,而且原因指向内容相近或入口不足,就按内容、内链、canonical 的顺序去查。改完之后给它一段时间重新评估,不要当天没变化就改第二遍。