打开 GSC 的页面索引报告,最上面那格“已编入索引”往往不是重点。真正有信息量的,是下面一长串未编入索引里的状态词。这些词看着像结论,其实只是流程走到哪一步的记录。把它当成线索而不是判决,排查方向会清楚很多。
状态词对应的是流程里的位置
一个 URL 从被发现到出现在搜索结果里,大致要过几步:被链接或 sitemap 暴露出来(发现)→ 蜘蛛真的来请求(抓取)→ 拿到 HTML 并执行脚本(渲染)→ 系统判断这个页面该不该留、和别的页面比谁更能代表这个话题(索引选择)。报告里的状态词,基本都能塞进这四步里的某一步。
已发现,但尚未编入索引
意思是蜘蛛知道这个地址存在,但还没来抓,或者来了之后排不进队列。常见于几种情况:
- URL 只出现在 sitemap 里,站内没有可点的链接指向它;
- 站点整体抓取份额有限,蜘蛛把时间优先花在更新频繁、权重更高的目录上;
- 同一批自动生成的页面数量太大,短时间内消化不完。
这时候反复提交 sitemap 意义不大,更该做的是给关键页面补内链入口,让它们从“列表里的一行”变成“爬行路径上的一站”。数量特别大的模板页,也可以先想想是不是真的都需要留在索引里。
已抓取,但尚未编入索引
这一步更值得琢磨。蜘蛛已经拿到页面,内容也看了,最后却没放进索引。常见原因:
- 正文太薄,或大部分内容来自模板,独立信息量不足;
- 正文要靠 JavaScript 执行后才出现,渲染环节没拿到同样的内容;
- 和站内其他页面高度相似,系统认为多留一条没有增益。
排查时别只盯着这一个 URL,把同模板的几十条一起打开对比,通常能看出是模板层面的问题,还是个别页面的问题。
“已排除”下面还分好几种
这个大类里混着完全不同的情况,不能一起处理:
- 被 noindex 排除:自己写的指令,属于预期结果;
- 备用网页(有规范的替代页面):canonical 或系统判断指向了另一个 URL,要确认那个目标是不是你想保留的;
- 重复网页,未选择规范版本:重点看规范版本选得对不对;
- 软 404:返回 200 但内容接近空页,常见于先删内容没处理状态码;
- 已找到但无法抓取 / 被 robots.txt 阻止:指令或规则挡住了蜘蛛;
- 404 与重定向:多半是正常状态,前者说明地址已不存在,后者说明跳转生效。
把它们分开看,真正需要动手的其实只有其中几类。
几个看报告的习惯
- 按目录或模板分组看,比盯总量有用。某一类模板集体出状况,和散落几个 URL 的含义完全不同。
- 看趋势,不看某一天的抖动。索引本来就有正常的进出。
- 点开“示例网址”实际打开页面看一眼,很多问题打开就明白了。
- 有条件的话和服务器日志对照,确认状态是“没抓”还是“抓了没留”。
状态词描述的是结果,不是原因。它告诉你卡在哪一步,剩下的要靠看页面、看链接、看日志。
最后一句:报告是仪表盘,不是任务清单。哪些状态需要处理,取决于这个页面本身值不值得留在索引里——先回答这个问题,再决定要不要为它折腾。