打开后台的收录状态报告,最容易被做错的一件事,是把它当成一张待办清单——看到“已排除”就想去点提交,看到“已抓取未编入索引”就反复推送。实际上这份报告更像一张体检结果:它告诉你 URL 停在了链路的哪一段,而不是告诉你该按哪个按钮。
先把几十种提示归到四段链路上
一个 URL 从产生到出现在搜索结果里,大致要走四步:被发现、被抓取、被索引、被展示。报告里的状态提示,基本都能塞进这四段之一。
- 走完了:已编入索引。说明前几步都通了,剩下的只是展示层面的问题。
- 卡在中游:已发现但未抓取、已抓取但未编入索引。入口有了,抓取也发生了,问题出在优先级或质量判断上。
- 被挡在门外:robots.txt 屏蔽、noindex、需要登录、返回 4xx。这类是主动或被动拒绝,要先确认是不是你的本意。
- 被合并:重复网页、备用网页、未选定的规范网页。说明系统认为你给了多个地址指向同一份内容。
几个最常被误读的提示
已发现,目前未编入索引
含义接近“地址我知道了,但还没轮到你”。常见原因有三类:URL 埋得太深,只靠提交清单而没有站内链接;站点整体抓取次数有限,新页面排在后面;页面本身没明显问题,只是需要时间。这时反复提交不会带来额外作用,更值得做的是把它接到一个确实会被抓取的列表页或正文里。
已抓取,尚未编入索引
这一步已经拿到了页面内容,卡在索引判断上。值得回头看的是:正文是不是太短、模板文字占比是不是过高、是否与站内其他页面高度相似、是否主要靠 JS 才能渲染出内容。这个状态通常不会因为等待而自愈,改内容比改提交方式有效。
重复网页与未选定的规范网页
同一份内容出现在多个地址时,系统会自己挑一个作为代表,其余归入备用网页。如果发现代表页挑错了,先检查 canonical 是否写反、是否指向了重定向地址或参数页。这类问题不解决,后面所有收录动作都是白费力气。
已排除:noindex 与 robots.txt
两者都会让 URL 从索引里消失,区别在于能不能被看到。noindex 允许抓取后再排除,robots.txt 直接挡在门口,抓都抓不到。想让一条页面彻底消失,两者效果接近;想让页面留在索引里只是不展示摘要,则两者都不适用。
读报告时容易踩的几个坑
- 数据有滞后。当天改完当天去看,看到的往往还是旧结果,至少隔一两个抓取周期再下结论。
- 分类只记一个。同一条 URL 可能同时符合重复和单薄两个条件,报告只会显示其中一种,别把它当成全部原因。
- 按目录聚合。多数报告是按路径分组的,真正要看的往往是具体某条 URL,需要点开细看。
- 只看快照不看趋势。数量偶尔波动很正常,连续两周朝同一方向变化才值得处理。
一个可以照着走的核对顺序
- 确认这条 URL 到底该不该被收录。栏目页、参数页、站内搜索结果页常常本来就不该进索引。
- 检查能否被抓取:返回码是不是 200、有没有被 robots.txt 挡住、是否强依赖 JS 渲染。
- 检查有没有给出排除信号:noindex、canonical 指向别处、meta 与 HTTP 头冲突。
- 检查内容本身:与站内其他页面的重合度、正文的有效信息量、是否有独立价值。
- 检查入口:有没有内链、有没有进 sitemap、离首页几跳。
- 把结论记进自己的台账,隔一段时间回看状态有没有变化,避免重复排查同一批 URL。
收录是结果,不是开关。报告上的每一条提示,指向的都是链路上某个具体环节,而不是一个可以反复点击的按钮。
按这个顺序走一遍,多数“为什么没收录”的问题都能落到一个具体动作上:要么补入口,要么改内容,要么收住本来就不该被收录的地址。真正难的不是读报告,而是忍住不去做那些看起来有用、实际不改变任何环节的操作。