做過一段時間站点的人,多半遇到過這種情况:某個 URL 前几天在搜尋结果里還能搜到,過一阵再查就没了,再過几天又冒出来。這種来回並不一定意味着站点被處理,更常见的原因是索引狀態本身就在動態調整。把“收錄”当成一次性動作,排查时很容易走错方向。
先接受一個前提:收錄狀態是動態的
索引不是一份攒够就鎖死的名單,它更像一個持續更新的中間狀態。一個 URL 能不能出現在结果里,取决于目前這一刻搜尋引擎對它的判断:可不可以抓、值不值得留、有没有別的 URL 更合适代表同一份内容。任何一條變了,狀態就可能跟着變。
所以看到頁面消失,第一步不是马上改站点,而是先判断它属于哪一類變化。下面四種情况占了大多數。
第一類:站点自己發出的信号變了
這類最容易查,也最常被忽略。頁面的收錄狀態往往是跟着 head 区和服務器配置走的,而這些地方经常被批量改動。
- noindex 被誤加:模板改版、组件复用、測試环境配置带上线,都可能让一批頁面的 meta robots 變成 noindex。
- robots.txt 變動:新增一條屏蔽規則,可能刚好覆盖了某個目錄。
- 頁面被 301 或 404:URL 規則調整、栏目合並,老地址被跳走或直接消失。
- canonical 改了指向:本来自指的頁面,被统一指到了列表頁或其他版本。
這一類通常有成批特征:同一模板下的頁面同时出問题。如果你的站点最近動過模板、路由或 robots 配置,優先從這里查。
第二類:蜘蛛這次抓不到,或抓到的不是原来那份
抓取失敗不會立刻让頁面從索引里消失,但如果持續失敗,頁面被重新评估时就會缺少依據。
- 服務器間歇性返回 5xx、响應超时,尤其是高峰期和資料源卡顿的时候。
- CDN、WAF 或频控把蜘蛛的請求当成異常流量拦掉。
- 内容靠前端渲染,而某次改版後渲染结果變空,返回 200 但正文不见了。
- 頁面内容被登入墙、地域限制或彈窗遮住主体部分。
這一類的問题在日誌里比在頁面上更容易看出来。把该 URL 近一段時間的抓取记錄拉出来,看狀態碼和响應体积是否稳定,通常就有答案。
第三類:内容被重新判断,不再值得單獨留一個位置
没有报错、抓取也正常,頁面還是掉了,那多半是内容层面的判断變了。常见的有:頁面主体變薄、大面积重复模板文字、與其他頁面高度相似、聚合頁和參數頁大量生成。
這類情况往往不是某個頁面單獨的問题,而是同一批頁面一起出現波動。與其一個個去猜,不如按模板或按目錄抽样,看是不是同類頁面同时在動。
第四類:不是消失,是被另一個 URL 顶替
還有一種情况容易被誤判成“掉了”:同一份内容有多個地址,比如带與不带 www、带參數與不带參數、PC 版與移動版、大小寫不同。搜尋引擎在收敛时會把展示位置換到它認為更合适的那一個。
這时用具体 URL 去查,可能查不到结果,但用頁面标题去搜,内容還在,只是換了入口。判断方式是:搜标题,看命中的 URL 是不是同站的其他地址。
一套可用的排查顺序
- 先確認查询方式一致:同一個搜尋引擎、同一地区、同一设备、同一時間点對比,別拿 site 數量和直查结果混着看。
- 查该 URL 最近的抓取日誌,看狀態碼、响應体积、抓取频次有没有異常。
- 打開頁面源碼,確認 meta robots、canonical、hreflang 是否符合预期。
- 检查 robots.txt 目前版本和近期改動记錄。
- 對比頁面内容與上次抓取时的差异,看是改版了還是内容變少了。
- 用标题在站内和站外搜一遍,確認是不是被同站其他 URL 替代。
- 以上都没問题,再考虑通過站長平台的 URL 检查提交一次,观察後續狀態。
這個顺序的價值在于:前三步能排掉绝大部分自己造成的問题,後面几步才涉及需要等待和观察的部分。反過来做,容易在没問题的地方反复折腾。
几個容易踩的坑
- 一發現消失就立刻改版或者批量調 URL,把原本只是波動的狀態變成了真問题。
- 把 site 指令返回的數量当成收錄總量指标,每天盯着數字涨跌。
- 频繁修改标题和描述,让頁面在短時間内反复被重新處理。
- 把索引波動直接等同于站点被降權,忽略抓取失敗和配置改動這些更實际的原因。
收錄狀態變化本身是常態。先分清是站点改的、蜘蛛没抓到、内容被重估,還是 URL 被顶替,再决定要不要動手,比反复提交和改版更有效。