在站长平台或搜索控制台里,“已发现未抓取”和“已抓取未索引”是两个容易混淆的状态。它们听起来都像“没收录”,但卡住的位置不一样。弄清区别,排查方向才不会跑偏。
先把两个状态放回流程里
一个 URL 从被发现到出现在索引里,大致要经过:发现 URL → 排队抓取 → 抓取页面 → 质量判断 → 进入索引。每个环节都有可能停下来。
- 已发现未抓取:地址已经被搜索引擎知道,但还没轮到抓取。可能来自 sitemap、内链、外链或站长平台提交。
- 已抓取未索引:页面已经被抓取过,但搜索引擎判断它暂时不值得放进索引,或者有技术信号阻止它进入索引。
- 已排除:通常有明确的指令或规则,比如 noindex、canonical、robots.txt、重复内容合并等。
这里的关键区别是:前者是抓取调度问题,后者是索引决策问题。抓到不等于收录,发现也不等于马上抓取。
已发现未抓取:多半是排队和优先级问题
如果大量 URL 停在“已发现未抓取”,先不要急着改页面内容,优先看抓取端。
常见原因
- 站点抓取预算有限:小站或新站,搜索引擎不会无限抓取,低价值 URL 会排在后面。
- URL 发现渠道太多但质量不齐:sitemap 里堆了大量参数页、筛选页、重复地址,真正重要的页面反而不突出。
- 内链太少或太深:页面只有 sitemap 提到,没有站内点击路径,发现后也容易被放在低优先级。
- 服务器响应慢或频繁超时:抓取队列会绕开不稳定地址。
- 页面更新频率低:长期不更新的列表页、归档页,抓取优先级自然下降。
可以检查什么
- 看抓取日志,确认蜘蛛最近有没有访问这些目录,访问频率是否下降。
- 检查 sitemap 是否只放了 canonical 地址,是否混入大量参数和重复 URL。
- 给重要页面增加站内入口,缩短点击深度。
- 观察服务器响应时间,尤其是移动端和动态接口。
- 如果只是少量新页面,可以等待;如果大批量长期停滞,再考虑精简 URL 总量。
已发现未抓取不等于页面有问题。它更像排队:URL 太多、入口太杂、优先级不够时,抓取会往后排。
已抓取未索引:问题在抓取之后
这个状态说明蜘蛛已经来过,但页面没有进入索引。原因通常更靠近页面质量和索引规则。
常见原因
- 内容质量判断未通过:正文太少、模板重复、缺少独立信息。
- 重复内容:站内多个地址内容高度相似,搜索引擎选择一个代表版本,其他版本不进索引。
- canonical 指向别处:页面自己声明了另一个规范地址,索引会集中到目标页。
- noindex 或 robots 限制:虽然被抓取,但指令明确要求不索引。
- 渲染问题:正文依赖 JavaScript,抓取时只拿到空壳,质量判断拿不到有效内容。
- 软 404:页面返回 200 但内容像错误页、空列表或无结果页。
可以检查什么
- 先确认页面是否有 noindex、canonical 指向其他地址。
- 对比被抓取版本和用户看到的版本,尤其是 JS 渲染内容。
- 检查同站是否有多个 URL 输出相同或接近的内容。
- 看页面正文占比,模板和导航是否占了大头。
- 如果页面属于筛选、排序、分页参数,判断它是否应该被索引。
两个状态的排查顺序不一样
遇到“没收录”时,先分类,再动手。
- 停在“已发现未抓取”:优先查 URL 发现、内链、sitemap、抓取预算、服务器稳定性。
- 停在“已抓取未索引”:优先查页面质量、重复内容、canonical、noindex、渲染结果。
- 如果两边都有:先处理抓取端,让重要 URL 先被访问,再看索引端。
把这两个状态混在一起看,容易出现一种无效操作:页面明明已经抓取,却反复提交 sitemap;或者页面根本没被抓取,却一直改正文。先确认卡在哪一段,再决定改什么。
收录不是单一开关。URL 发现、抓取调度、质量判断和索引选择是几道不同的门。
日常运营中,可以把“已发现未抓取”和“已抓取未索引”当成两个检查入口。前者看抓取效率,后者看页面是否值得留下。分开看,排查会清楚很多。