站点收录出问题时,很多人第一件事是打开搜索后台的覆盖率报告,看到某个状态就下结论:一定是内容质量差,或者一定是被降权。实际上这份报告给出的是过程状态,不是原因判断。同一个状态背后可能有好几种原因,处理方式也完全不同。
先把状态分成两类
报告里的状态名有几十种,粗分其实只有两类:一类是“还没轮到”,一类是“被明确拒绝”。前者要改善抓取路径和页面价值,后者要先确认排除是不是自己设的。
- 还没轮到:已发现尚未编入索引、已抓取尚未编入索引。URL 已经被系统知道,只是还没走完流程。
- 被拒绝或被替换:被 noindex 排除、被 robots.txt 拦截、重复网页(系统选了另一个规范页)、备用网页、软 404。
混淆这两类的后果很常见:把“还没轮到”当成惩罚,急着改内容;把“被替换”当成抓取不够,拼命加内链。
几个高频状态的实际含义
已发现,尚未编入索引
系统知道了这个 URL,但还没抓,或者抓它的优先级很低。常见于新站、内链很少的深层页面、批量生成页面的尾部。要处理的是抓取入口:有没有从首页几跳之内点到、sitemap 里是否正确列出、站内是否存在大量低价值 URL 把抓取分走了。
已抓取,尚未编入索引
页面已经被抓下来了,但没有进入索引。这时抓取不再是瓶颈,要看页面本身:内容是否与站内其他页面高度相似、是否只是参数或列表的组合、正文是否薄到没有可索引的独立信息。这种情况下继续重复提交 URL 意义不大。
重复网页,系统选择了不同的规范网页
你指定的 canonical 和系统判断的规范页不一致。常见原因是两页内容确实很像,或者你指定的那个页面本身有 noindex、被拦截、返回错误。先确认目标页可正常访问且允许索引,再回头看内容相似度。
被 noindex、被 robots 拦截
这类是明确排除,第一步是确认排除是不是自己设的。测试环境遗留的 meta noindex、误写进 robots.txt 的目录,都会造成大面积“已排除”。
备用网页、软 404
备用网页多数与移动端版本或重复版本有关,通常不需要单独处理,但值得确认主版本有没有被收录。软 404 是返回 200 却没有实际内容的页面,需要判断是补齐内容还是合并到其他页面。
报告告诉你卡在哪一步,不会告诉你为什么。原因要从页面本身、内链路径和站点结构里找,只看状态名称容易走偏。
按顺序自查,别跳步
- 确认 URL 能正常打开,返回 200,且不是跳转链的中间地址。
- 确认没有被 robots.txt、meta noindex、X-Robots-Tag 挡住,也没有被登录或地域限制挡住。
- 看这个 URL 从站内能不能点到,路径有几跳,有没有稳定的入口。
- 和同类型已经收录的页面比一比:结构相近、长度相近,为什么一个进了索引另一个没进。
- 确认页面对用户有独立价值,不是为凑数量而生成的。
- 以上都正常,再考虑提交或继续等待,并给自己定一个观察周期。
几个容易踩的坑
- 把报告当实时数据,每天盯着一两个 URL 反复看。报告本身有延迟,短期变化说明不了什么。
- 看到“未编入索引”就删页面或改标题。先分清是页面问题还是入口问题。
- 只提交 sitemap,不修内链。sitemap 能帮助发现 URL,但替代不了站内结构。
- 把收录当成目标本身。收录只是结果,页面能不能解决问题才是它留下来的理由。
状态名只是一个方向标。顺着“能不能抓、抓了值不值得留、留下来会不会和别的内容打架”这条线走,比对着状态名猜原因要靠谱得多。