打开搜索后台的索引覆盖率报告,第一反应往往是看总数涨了还是跌了。但这个报告真正的价值不在总数,而在于它把站内 URL 分成了几类状态。同一批页面被分到不同类别里,处理方式完全不同,混在一起看只会越看越乱。
先看清报告里的几类状态
不同后台的叫法略有差异,但大体可以归成三组:
- 已收录:页面被抓取且进入索引,至少具备被搜到的条件。
- 已排除:系统知道这个 URL 存在,但有理由不把它放进索引。
- 异常与错误:抓取层面就出问题了,比如服务器错误、重定向异常、被 robots.txt 拦下。
其中「已排除」里的原因最多,性质差别也最大,需要再往下拆一层。
已排除里最常见的几类及含义
已发现,尚未抓取
系统知道 URL,但还没排上抓取队列。这通常和抓取预算、站点响应速度、URL 总量有关,属于抓取环节的问题,不是质量判定。数量长期不降,才需要回头核对服务器响应和站内入口结构。
已抓取,尚未编入索引
页面已经被抓到了,但系统暂时没有把它放进索引。这一类最容易被误读成「被惩罚」。实际上它更像一个待定状态:内容是否足够独立、是否和站内其他页面高度相似、页面主题是否清晰,都会影响后续判断。要做的是核对这批 URL 的页面质量与重复情况,而不是反复提交。
重复网页,系统选择了其他规范页
说明系统认为这个 URL 和另一个 URL 内容相近,并把另一个当成了主版本。此时要核对两件事:一是 canonical 是否指向了正确的版本;二是这两个页面是不是真的应该同时存在。如果其中一个本来就该合并,要处理的是内容,不是标签。
已被 noindex 或 robots.txt 屏蔽
这类是人为设置的排除,属于预期结果。核对时只需确认:被屏蔽的 URL 是不是你确实不想收录的那批。如果误伤,改回来即可。
核对顺序:从量大的类别开始
- 先看哪一类占比最大。占比最大的那类,决定了这一轮要解决的主要问题。
- 再看这些 URL 有没有共同特征:是否集中在某个栏目、某种参数、某个模板。
- 抽样几条,确认实际原因和类别描述是否一致。类别描述只是系统的判断,真实原因要回去看页面。
- 按特征批量处理,处理完观察一到两周,再看比例变化。
逐条查单个 URL 效率很低,而且很容易把模板层面的问题当成偶发问题。
几个常见的误判
- 把「已抓取未编入索引」当成永久拒绝。它是动态状态,会随内容和站内结构调整而变化。
- 把「已排除」等同于「出问题了」。大量已排除是正常的,比如分页、筛选参数、后台页面。
- 用提交量冲抵收录量。提交只影响发现速度,不解决页面本身的判断问题。
- 只看总数不看分类。总数下跌有时只是把一批重复 URL 清理掉了,未必是坏事。
索引覆盖率是一张分类表,不是一张成绩单。先归类,再决定要不要动手。
什么时候该动,什么时候该等
如果某一类里绝大多数 URL 都是你本来就不想收录的,那什么都不用做。如果某类里集中了核心内容页,而且原因指向内容相近或入口不足,就按内容、内链、canonical 的顺序去查。改完之后给它一段时间重新评估,不要当天没变化就改第二遍。