收錄數量從来不是一條直线。正常运营的站点,索引量日常上下浮動几十上百條都很常见,幅度小、過几天自己能回彈的波動,通常不需要专门處理。真正值得動手的,是持續下降,或者掉了之後長期不回来。在打開代碼之前,先把問题分到“抓取端”還是“索引端”,後面的判断會省很多力气。
先確認是不是真的掉了
报告里的數字和實际收錄之間,往往隔着几层誤差。動手排查前,先做几個基础確認:
- 报告的更新本身有滞後,昨天的資料可能只反映几天前的狀態;
- 同一份資料在不同工具、不同视图下的口径不一样,先確認自己看的是同一個指标;
- 抽样查询的结果波動很大,抽十個词全都没了,不代表整站被清空;
- 確認掉的到底是全站,還是某個目錄、某種模板。
如果连續一两周都在下降,並且抽样结果、服務器日誌、索引报告三者的方向一致,那基本可以当成真問题来處理。
抓取端:爬虫来得少了
收錄的前提是抓取。如果日誌里爬虫的訪問量明顯减少,先看這几處。
服務器與响應
5xx 集中出現、响應時間明顯變長,或者防火墙把爬虫当成攻击拦掉,都會让爬虫主動降低訪問频率。這類問题往往先影响抓取,再過一段時間才反映到收錄上,所以看到收錄掉的时候,日誌里的異常可能已经發生好几天了。
robots.txt 與頁面級指令
robots.txt 的一次改動、模板里誤加的 noindex,都可能让一批頁面被挡在外面。這類改動容易被忽略,因為頁面本身看起来完全正常,用戶和爬虫之外的檢測工具都看不出異常。
抓取预算被占用
站内搜尋结果頁、篩選參數的各種组合、日歷類無限翻頁,會持續消耗抓取量。当這些 URL 的數量膨胀到一定程度,重要頁面被訪問的频率就會明顯下降,表現為“收錄没被删,但新内容迟迟進不去”。
索引端:抓到了却没留下
如果抓取量正常,頁面也返回 200,但索引量在掉,問题多半出在质量判断上。
内容重复與價值稀释
多城市頁、規格頁、分頁列表,如果主体内容高度相似,搜尋引擎會自己挑一個版本留下,其余的登出索引。這類减少不一定是坏事,關键是確認留下的那個版本是不是你想留的。
URL 規范發生變動
改版換了目錄结构、统一了大小寫或结尾斜杠,舊 URL 没有正确指向新地址,就會出現舊地址已经登出、新地址還没進来的空档期。這個阶段收錄下降属于正常過程,重点看新地址有没有被逐步抓取。
模板或结构大改
正文被折叠、主要内容改成 JavaScript 渲染、内鏈大面积取消,都會让原本表現稳定的頁面變得难以判断,進而被移出索引。
一個可以照着走的排查顺序
- 核對指标口径,確認下降趋势到底持續了多久;
- 拉一段時間日誌,看爬虫訪問量和响應碼的變化;
- 對比下降前後的模板、robots.txt、跳轉規則有没有被動過;
- 抽样下降最明顯的頁面,看它們是否属于同一類模板;
- 检查這些頁面是否存在重复内容,canonical 指向是否合理;
- 確認清楚之後再動手,一次只改一處,留出观察周期。
收錄量下降是结果,不是原因。在没弄清是哪一類頁面、哪個环节出問题之前,批量提交、批量改 canonical、批量加内鏈,很可能把原来的問题盖住,反而更难定位。
收錄波動本身不值得紧張,值得紧張的是不知道為什么波動。把抓取和索引分開看,把模板和 URL 分類看,多數下降都能找到對應的入口,也能判断出哪些只需要等待,哪些必须马上處理。