網站收錄

收錄數量掉了又涨回来:波動背後常见的几類原因

收錄量上下浮動是常態,真正需要動手的是持續下降。這篇文章把收錄波動拆成抓取端和索引端两類問题,给出從指标核對、日誌比對到模板自查的排查顺序,帮你在改代碼之前先定位到具体环节,避免盲目批量操作反而把問题盖住。

網站收錄

收錄數量掉了又涨回来:波動背後常见的几類原因

收錄數量從来不是一條直线。正常运营的站点,索引量日常上下浮動几十上百條都很常见,幅度小、過几天自己能回彈的波動,通常不需要专门處理。真正值得動手的,是持續下降,或者掉了之後長期不回来。在打開代碼之前,先把問题分到“抓取端”還是“索引端”,後面的判断會省很多力气。

先確認是不是真的掉了

报告里的數字和實际收錄之間,往往隔着几层誤差。動手排查前,先做几個基础確認:

  • 报告的更新本身有滞後,昨天的資料可能只反映几天前的狀態;
  • 同一份資料在不同工具、不同视图下的口径不一样,先確認自己看的是同一個指标;
  • 抽样查询的结果波動很大,抽十個词全都没了,不代表整站被清空;
  • 確認掉的到底是全站,還是某個目錄、某種模板。

如果连續一两周都在下降,並且抽样结果、服務器日誌、索引报告三者的方向一致,那基本可以当成真問题来處理。

抓取端:爬虫来得少了

收錄的前提是抓取。如果日誌里爬虫的訪問量明顯减少,先看這几處。

服務器與响應

5xx 集中出現、响應時間明顯變長,或者防火墙把爬虫当成攻击拦掉,都會让爬虫主動降低訪問频率。這類問题往往先影响抓取,再過一段時間才反映到收錄上,所以看到收錄掉的时候,日誌里的異常可能已经發生好几天了。

robots.txt 與頁面級指令

robots.txt 的一次改動、模板里誤加的 noindex,都可能让一批頁面被挡在外面。這類改動容易被忽略,因為頁面本身看起来完全正常,用戶和爬虫之外的檢測工具都看不出異常。

抓取预算被占用

站内搜尋结果頁、篩選參數的各種组合、日歷類無限翻頁,會持續消耗抓取量。当這些 URL 的數量膨胀到一定程度,重要頁面被訪問的频率就會明顯下降,表現為“收錄没被删,但新内容迟迟進不去”。

索引端:抓到了却没留下

如果抓取量正常,頁面也返回 200,但索引量在掉,問题多半出在质量判断上。

内容重复與價值稀释

多城市頁、規格頁、分頁列表,如果主体内容高度相似,搜尋引擎會自己挑一個版本留下,其余的登出索引。這類减少不一定是坏事,關键是確認留下的那個版本是不是你想留的。

URL 規范發生變動

改版換了目錄结构、统一了大小寫或结尾斜杠,舊 URL 没有正确指向新地址,就會出現舊地址已经登出、新地址還没進来的空档期。這個阶段收錄下降属于正常過程,重点看新地址有没有被逐步抓取。

模板或结构大改

正文被折叠、主要内容改成 JavaScript 渲染、内鏈大面积取消,都會让原本表現稳定的頁面變得难以判断,進而被移出索引。

一個可以照着走的排查顺序

  1. 核對指标口径,確認下降趋势到底持續了多久;
  2. 拉一段時間日誌,看爬虫訪問量和响應碼的變化;
  3. 對比下降前後的模板、robots.txt、跳轉規則有没有被動過;
  4. 抽样下降最明顯的頁面,看它們是否属于同一類模板;
  5. 检查這些頁面是否存在重复内容,canonical 指向是否合理;
  6. 確認清楚之後再動手,一次只改一處,留出观察周期。
收錄量下降是结果,不是原因。在没弄清是哪一類頁面、哪個环节出問题之前,批量提交、批量改 canonical、批量加内鏈,很可能把原来的問题盖住,反而更难定位。

收錄波動本身不值得紧張,值得紧張的是不知道為什么波動。把抓取和索引分開看,把模板和 URL 分類看,多數下降都能找到對應的入口,也能判断出哪些只需要等待,哪些必须马上處理。