收录不是一个完成即锁定的状态。一个 URL 这周在索引里,下周可能就查不到了;有的过几天自己回来,有的则长期不出现。比起反复提交 URL,先弄清它为什么掉出去更有意义。
第一步:确认它真的掉出了索引
先排除误判,常见的伪掉索引有几种:
- 用 site: 查不到,但直接搜完整 URL 能找到,说明页面还在,只是没匹配到你的查询词。
- 搜索结果里的标题或摘要变了,让你以为换了一页,其实只是索引里的快照更新。
- 不同地区、不同设备看到的索引结果本来就可能不一样。
- 站点整体抓取异常期间查询,得到的是临时结果。
确认的方法还是回到后台工具:看该 URL 的编入索引状态,以及最后一次抓取时间。如果抓取时间还停在被移除之前很久,问题多半先出在抓取环节,而不是收录判断环节。
页面自身的变化
内容被大幅改写或删减
页面被收录后又被改成一段说明、一句敬请期待,或者只剩模板文字,索引里对应的内容就没有保留价值了。搜索引擎在下一次抓取后会把它判成低质页或空页,从索引中撤掉。改版时把正文模块临时关掉,是最常见的触发场景。
返回的状态码变了
服务器异常、后端报错、路由配置出错,都可能让原本 200 的页面变成 404 或 500,或者返回 200 但正文为空(软 404)。这些都是明确的移除信号。
配置层面的失误
robots.txt 与 noindex 被顺手加上
测试环境、灰度环境、临时活动页的配置被合并回线上,是很典型的事故。注意两者的分工:robots.txt 挡住抓取后,蜘蛛读不到页面里的 noindex,结果反而可能长期停留在旧索引里;真正要让页面下架,用 noindex 更直接。
canonical 指向被改
模板统一设置 canonical 时,容易把带参数、带分页或移动版的地址全部指向同一个页面。被指向的那一页留下,其余被合并,看起来就像掉收录。
改版、CDN 与渲染问题
换域名、换框架、上 CDN 之后,如果 HTML 结构大改、正文依赖 JS 渲染而渲染失败,抓取到的就是一具空壳。抓取成功不等于收录成功,这种情况下页面往往会先掉出索引。
被别的版本取代
同一篇内容出现在多个位置时,索引里通常只保留一份。如果别处页面更新更快、外部链接更多,你这一版就可能被替换掉。内容被大量转载、镜像站先被抓到,都会造成这种结果。
建议的排查顺序
- 查该 URL 当前返回的状态码和实际渲染结果,确认不是 404、500 或空壳。
- 查页面 HTML 里的 robots meta、响应头中的 X-Robots-Tag 以及 canonical,看是否被误改。
- 查 robots.txt 是否有新增规则误伤了该目录。
- 看最后一次抓取时间,判断是抓取中断,还是抓取正常但被判定为低质。
- 搜同一内容的其他地址,判断是否发生了重复内容收敛。
- 以上都正常后,再重新提交该 URL,等待下一轮抓取。
恢复收录大概要多久
没有固定时间。配置类问题修好后,一般要等下一次抓取才会反映出来;被判定为低质的情况,需要先把页面内容真正做回有价值的样子,再配合内链和提交。索引规模大的站点,处理周期会更长。
不要指望提交一次就能立刻恢复收录。提交只是把地址放进待抓取队列,收录与否最终仍由页面本身和站点整体质量决定。