先接受一個前提:收錄量本来就是波動的
索引數量不是库存表,而是一個持續重算的滚動结果。新頁面進来、舊頁面被合並、參數頁被收口、站点改版,都會让這個數字上下浮動。判断“下滑”之前,先看两件事:幅度和持續時間。單日或少量的减少,通常不需要做任何動作;连續两三周、並且集中在某個目錄时,才值得排查。
先看结构,再看總量。總量不變但核心頁被替換,問题和總量下降一样嚴重。
第一步:確認减少的是 URL 還是頁面
收錄數字下降,並不代表内容消失。常见的三種情况是:頁面合並到新的 URL、參數或分頁被收口、多個版本被 canonical 归一。這几種都會让索引數下降,但用戶能訪問到的内容並没有减少。所以核對时不要只盯着數字,要先抽一批下降的 URL,看它們現在是 200、301 還是 404。
三類原因,對應的信号不一样
頁面真的消失了
下线、誤删、發布回滚、CMS 改版導致路径變化,都會出現這種情况。信号比較直接:抓取日誌里 404、410 明顯增多,覆盖报告中“已刪除(404)”一類的計數上升。這时候要處理的不是索引,而是連結和重定向。
蜘蛛不再来,或者来得少了
robots.txt 改動、服務器間歇性 5xx、CDN 或防火墙拦截、内鏈断裂,都可能让抓取量骤降。信号是:抓取日誌條目减少,平均响應時間上升,異常狀態碼占比變高。抓取减少之後,索引往往滞後一两周才開始變化,所以下滑的時間点通常晚于真正的故障時間点。
頁面還在,索引被替換了
canonical 設定、内容改版後重新评估、聚合頁與詳情頁的取舍,都可能让某個 URL 從索引里登出,改由另一個 URL 代表。信号是:URL 返回 200、正文完整、抓取也正常,但覆盖报告顯示類似“重复網頁,系統選擇了不同的規范網頁”。這属于規范選擇,不是抓取故障。
推荐的核對顺序
- 拉取近两周的覆盖报告與站点查询结果,按目錄分组比較,找出下降最集中的那部分。
- 抽样 20 到 30 個下降 URL,逐個看返回狀態碼、正文是否完整、canonical 指向哪里。
- 回到抓取日誌:這些 URL 近两周是否還被訪問,响應碼與响應耗时是什么水平。
- 對照時間轴:下滑前後是否做過改版、robots 調整、參數收口或站点地图替換。
- 確認原因之後,再决定是修狀態碼、修内鏈,還是接受這次規范合並。
容易弄错的几個地方
- 把“已排除”当成“被惩罚”。多數排除是重复或規范選擇的结果,不是负面處理。
- 把站点查询结果当作精确總數。它是估算值,只适合看數量級和趋势。
- 只看總量不看頁面類型。索引總量可能被大量低價值頁面撑住,核心頁减少反而不明顯。
- 下滑时立刻补交站点地图。如果這些 URL 本身已经 404 或不可抓取,提交不會改變结果。
處理原則:先修可抓取性,再谈收錄
如果問题出在狀態碼、服務器响應或拦截規則上,先把這些恢复,再观察索引是否自然回升。如果問题出在 URL 規范選擇上,要检查 canonical、内鏈和站点地图是否指向同一個版本,避免互相矛盾。如果是真正的誤删,先恢复内容並確認路径,再處理舊連結的跳轉,顺序反了只會让日誌更乱。
收錄不是一次性的開關,它會随頁面结构、内容狀態和抓取情况持續變化。把下降原因落到具体頁面,比急着把數字改回去更有用。