收錄列表里少了一個頁面,很多人的第一反應是站点被整体降權了。實际情况通常没有這么大,一個頁面從索引里消失,多數时候只跟它自己有關。要做的不是立刻抢救,而是先弄清它属于哪一種情况。
第一步:先確認它是不是真的不在索引里
用 site: 查询只能当作粗略參考,结果可能有延迟,也可能只展示一部分。更可靠的做法是在站長工具里查這個具体 URL 的狀態:是已编入索引、已發現但未编入索引、已抓取但未编入索引,還是已被排除。排除原因那一栏寫的是什么,往往比结论本身更有用。
常见情形:五種原因對應完全不同的處理
一、正常淘汰
頁面内容已经過时,長期没有訪問和引用,或者它原本就是临时活動頁、阶段性专题頁。索引對這類頁面的保留意愿會慢慢下降,最终移出属于正常現象,不需要专门抢救。
二、被站内另一個 URL 顶替
同一段内容存在多個地址,canonical 指向其中之一,或者蜘蛛自己判断哪個更像主版本。這时被移出的那個 URL 並不是出错,而是被合並了。想让被合並的地址重新獨立存在,得先解决内容重复本身,而不是去改跳轉。
三、被指令或權限挡住
頁面上加了 noindex,robots.txt 挡住了抓取,頁面在登入墙之後,或者模板升級时把标簽誤带到了整批頁面上。這類頁面即使之前收錄過,也會在下次抓取後被移除。批量改模板、改栏目配置的时段,這類問题出現得最集中。
四、技術层面的反复出错
服務器間歇性返回 5xx,跳轉鏈拉得太長,或者頁面改版後主体内容没有正常輸出。蜘蛛连續几次都拿不到稳定结果,可能先把它移出索引,等站点稳定了再看。
五、站点结构調整留下的尾巴
改版、換目錄、合並栏目之後,舊 URL 没有做 301,或者 301 指向的頁面已经不存在。指向断鏈的舊地址會被逐步清理掉,最後在索引里彻底消失。
排查顺序建议
- 在站長工具里查這個 URL 的索引狀態和排除原因。
- 直接訪問该 URL,看返回狀態碼和實际内容,判断蜘蛛看到的是不是同一份。
- 检查頁面源碼里的 robots meta、canonical,以及该地址在 robots.txt 中是否可抓取。
- 判断是否被其他 URL 合並:搜标题或一段獨有文字,看结果里出現的是哪個地址。
- 如果 URL 發生過變更,检查舊地址到新地址的跳轉鏈是否一步到位。
- 最後再看内鏈,是否還有頁面在指向這個已经出問题的地址。
恢复收錄要做的事
原因不同,動作也不同。被指令挡住的,改掉指令後等它重新抓取;被合並的,先處理重复内容再谈獨立收錄;断鏈的,把跳轉修好或恢复頁面。真正需要重新提交 URL 的场景其實不多,大多數情况下,只要改對了,蜘蛛會自己回来。
一個頁面消失,先看排除原因,再决定要不要動手。為了让它回来而频繁調整 canonical、noindex 和跳轉,更容易让索引對站点的判断變得混乱。
與其每天盯着收錄數字的涨落,不如把每個消失的頁面归到具体原因上。能解释清楚的變化,就不用当成異常處理。