在搜索引擎的索引覆盖率报告里,URL 的状态通常不止“已收录”和“未收录”两种。很多站点会看到一批页面停在“已发现——尚未编入索引”或“已抓取——尚未编入索引”。这两个状态不是错误,但它们说明蜘蛛已经知道这个地址,却没有把它放进可展现的索引里。理解它们之间的差别,有助于判断下一步该优化抓取还是优化页面本身。
“已发现”和“已抓取”分别代表什么
“已发现”通常意味着搜索引擎从某个入口拿到了这个 URL,比如站内链接、sitemap、外链或提交接口。但蜘蛛还没有真正访问这个地址。它可能只是被记录进了待抓取队列。
“已抓取”则说明蜘蛛已经访问过页面,拿到了 HTML 或至少一部分响应内容,但索引系统在评估后没有把它收录。原因可能出在内容质量、重复度、页面价值判断,或者索引策略上。
简单说:已发现是“知道有这个地方”,已抓取是“已经来看过”,编入索引是“决定把它放进可搜索的库”。三者不是一回事。
卡在“已发现”时,先看抓取入口和抓取预算
如果大量 URL 长期停在“已发现”,蜘蛛可能没有足够动力或机会来抓。常见原因有:
- 页面没有站内链接指向,只能靠 sitemap 被发现,但 sitemap 里的地址很多,蜘蛛来不及逐个访问。
- 站点整体抓取预算被低价值页面占用,比如参数页、筛选页、重复列表页消耗了抓取频次。
- 服务器响应慢或经常超时,蜘蛛会降低回访频率。
- robots.txt 没有直接屏蔽,但抓取速率被限制得很低。
这时候可以把重点放在内链结构和抓取入口上:让重要页面从首页或栏目页有几层可点的链接,减少孤立 URL;清理或屏蔽明显低价值的参数组合;检查服务器日志,看蜘蛛实际访问了哪些目录,哪些目录一直没被碰过。
卡在“已抓取”时,重点转向页面质量和重复度
蜘蛛来过却没有收录,问题通常不在“能不能抓”,而在“值不值得收”。可以从几个方向排查:
- 页面主体内容是否太少。如果正文只有几句话,其余是导航、推荐、广告和版权信息,索引系统可能认为页面没有足够独特的信息。
- 是否与其他页面高度重复。同一套内容通过不同参数、不同排序方式生成多个 URL,或者商品描述直接复制供应商资料,都容易让页面互相稀释。
- 标题和摘要是否模板化。大量页面共用同一标题格式,缺少具体描述,索引系统难以判断每个页面的差异。
- 页面是否主要靠 JS 渲染。如果核心内容在客户端渲染后才出现,而蜘蛛拿到的初始 HTML 里没有实质内容,也可能影响判断。
- 是否有 noindex 或 canonical 指向别处。已抓取但未编入索引,有时是因为页面自己声明了不收录,或者 canonical 指到了另一个 URL。
这些因素不一定单独起作用,但通常会叠加。比如一个页面内容少、标题模板化、又和别的页面重复,那么即使被抓取,也很难进入索引。
URL 规范和站点结构也会影响状态流转
同一个页面如果有多个可访问地址,比如带 www 和不带 www、带尾斜杠和不带尾斜杠、大小写混用,蜘蛛可能分别抓取,但索引系统只选择其中一个作为规范版本。其他版本就容易停在“已抓取——尚未编入索引”或“重复网页,选择的规范网页不同”。
建议统一 URL 规则,并用 301 把非规范版本指向规范版本。同时检查站内链接是否混用了不同写法,避免自己把蜘蛛引向多个入口。
处理顺序可以这样安排
- 先看日志和索引报告,区分是“已发现”多还是“已抓取未收录”多。
- 如果是“已发现”多,优先补内链、精简 sitemap、降低低价值页面的抓取消耗。
- 如果是“已抓取”多,优先检查这些页面的正文独特性、重复度、标题摘要和 canonical 设置。
- 对确认无收录价值的页面,用 noindex 或 robots.txt 明确处理,避免继续占用抓取资源。
- 改动后观察一段时间,不要频繁反复修改,给蜘蛛重新评估留出周期。
索引状态是结果,不是原因。把抓取入口、页面质量和 URL 规范这三件事理顺,中间状态通常会慢慢减少。但也要接受一个事实:不是所有被发现的 URL 都值得被收录,有些页面主动挡在索引之外反而更合理。