网站收录

收录状态里的“已发现”“已抓取”“已排除”:分别卡在哪一步

页面索引报告里的状态词看起来像结论,其实只是流程记录。本文把“已发现”“已抓取”“已排除”拆回 URL 发现、抓取、渲染和索引选择这几步,说清哪些状态属于预期结果,哪些值得打开页面、对照日志去排查。

网站收录

收录状态里的“已发现”“已抓取”“已排除”:分别卡在哪一步

打开 GSC 的页面索引报告,最上面那格“已编入索引”往往不是重点。真正有信息量的,是下面一长串未编入索引里的状态词。这些词看着像结论,其实只是流程走到哪一步的记录。把它当成线索而不是判决,排查方向会清楚很多。

状态词对应的是流程里的位置

一个 URL 从被发现到出现在搜索结果里,大致要过几步:被链接或 sitemap 暴露出来(发现)→ 蜘蛛真的来请求(抓取)→ 拿到 HTML 并执行脚本(渲染)→ 系统判断这个页面该不该留、和别的页面比谁更能代表这个话题(索引选择)。报告里的状态词,基本都能塞进这四步里的某一步。

已发现,但尚未编入索引

意思是蜘蛛知道这个地址存在,但还没来抓,或者来了之后排不进队列。常见于几种情况:

  • URL 只出现在 sitemap 里,站内没有可点的链接指向它;
  • 站点整体抓取份额有限,蜘蛛把时间优先花在更新频繁、权重更高的目录上;
  • 同一批自动生成的页面数量太大,短时间内消化不完。

这时候反复提交 sitemap 意义不大,更该做的是给关键页面补内链入口,让它们从“列表里的一行”变成“爬行路径上的一站”。数量特别大的模板页,也可以先想想是不是真的都需要留在索引里。

已抓取,但尚未编入索引

这一步更值得琢磨。蜘蛛已经拿到页面,内容也看了,最后却没放进索引。常见原因:

  • 正文太薄,或大部分内容来自模板,独立信息量不足;
  • 正文要靠 JavaScript 执行后才出现,渲染环节没拿到同样的内容;
  • 和站内其他页面高度相似,系统认为多留一条没有增益。

排查时别只盯着这一个 URL,把同模板的几十条一起打开对比,通常能看出是模板层面的问题,还是个别页面的问题。

“已排除”下面还分好几种

这个大类里混着完全不同的情况,不能一起处理:

  • 被 noindex 排除:自己写的指令,属于预期结果;
  • 备用网页(有规范的替代页面):canonical 或系统判断指向了另一个 URL,要确认那个目标是不是你想保留的;
  • 重复网页,未选择规范版本:重点看规范版本选得对不对;
  • 软 404:返回 200 但内容接近空页,常见于先删内容没处理状态码;
  • 已找到但无法抓取 / 被 robots.txt 阻止:指令或规则挡住了蜘蛛;
  • 404 与重定向:多半是正常状态,前者说明地址已不存在,后者说明跳转生效。

把它们分开看,真正需要动手的其实只有其中几类。

几个看报告的习惯

  1. 按目录或模板分组看,比盯总量有用。某一类模板集体出状况,和散落几个 URL 的含义完全不同。
  2. 看趋势,不看某一天的抖动。索引本来就有正常的进出。
  3. 点开“示例网址”实际打开页面看一眼,很多问题打开就明白了。
  4. 有条件的话和服务器日志对照,确认状态是“没抓”还是“抓了没留”。
状态词描述的是结果,不是原因。它告诉你卡在哪一步,剩下的要靠看页面、看链接、看日志。

最后一句:报告是仪表盘,不是任务清单。哪些状态需要处理,取决于这个页面本身值不值得留在索引里——先回答这个问题,再决定要不要为它折腾。