收錄不是一個完成即鎖定的狀態。一個 URL 這周在索引里,下周可能就查不到了;有的過几天自己回来,有的則長期不出現。比起反复提交 URL,先弄清它為什么掉出去更有意义。
第一步:確認它真的掉出了索引
先排除誤判,常见的伪掉索引有几種:
- 用 site: 查不到,但直接搜完整 URL 能找到,說明頁面還在,只是没匹配到你的查询词。
- 搜尋结果里的标题或摘要變了,让你以為換了一頁,其實只是索引里的快照更新。
- 不同地区、不同设备看到的索引结果本来就可能不一样。
- 站点整体抓取異常期間查询,得到的是临时结果。
確認的方法還是回到後台工具:看该 URL 的编入索引狀態,以及最後一次抓取時間。如果抓取時間還停在被移除之前很久,問题多半先出在抓取环节,而不是收錄判断环节。
頁面自身的變化
内容被大幅改寫或删减
頁面被收錄後又被改成一段說明、一句敬請期待,或者只剩模板文字,索引里對應的内容就没有保留價值了。搜尋引擎在下一次抓取後會把它判成低质頁或空頁,從索引中撤掉。改版时把正文模块临时關掉,是最常见的触發场景。
返回的狀態碼變了
服務器異常、後端报错、路由配置出错,都可能让原本 200 的頁面變成 404 或 500,或者返回 200 但正文為空(软 404)。這些都是明确的移除信号。
配置层面的失誤
robots.txt 與 noindex 被顺手加上
測試环境、灰度环境、临时活動頁的配置被合並回线上,是很典型的事故。注意两者的分工:robots.txt 挡住抓取後,蜘蛛讀不到頁面里的 noindex,结果反而可能長期停留在舊索引里;真正要让頁面下架,用 noindex 更直接。
canonical 指向被改
模板统一設定 canonical 时,容易把带參數、带分頁或移動版的地址全部指向同一個頁面。被指向的那一頁留下,其余被合並,看起来就像掉收錄。
改版、CDN 與渲染問题
換域名、換框架、上 CDN 之後,如果 HTML 结构大改、正文依赖 JS 渲染而渲染失敗,抓取到的就是一具空壳。抓取成功不等于收錄成功,這種情况下頁面往往會先掉出索引。
被別的版本取代
同一篇内容出現在多個位置时,索引里通常只保留一份。如果別處頁面更新更快、外部連結更多,你這一版就可能被替換掉。内容被大量轉载、镜像站先被抓到,都會造成這種结果。
建议的排查顺序
- 查该 URL 目前返回的狀態碼和實际渲染结果,確認不是 404、500 或空壳。
- 查頁面 HTML 里的 robots meta、响應头中的 X-Robots-Tag 以及 canonical,看是否被誤改。
- 查 robots.txt 是否有新增規則誤伤了该目錄。
- 看最後一次抓取時間,判断是抓取中断,還是抓取正常但被判定為低质。
- 搜同一内容的其他地址,判断是否發生了重复内容收敛。
- 以上都正常後,再重新提交该 URL,等待下一轮抓取。
恢复收錄大概要多久
没有固定時間。配置類問题修好後,一般要等下一次抓取才會反映出来;被判定為低质的情况,需要先把頁面内容真正做回有價值的样子,再配合内鏈和提交。索引規模大的站点,處理周期會更長。
不要指望提交一次就能立刻恢复收錄。提交只是把地址放進待抓取队列,收錄與否最终仍由頁面本身和站点整体质量决定。