在索引覆盖率报告里,“已發現,尚未抓取”是很多人看到就會焦虑的一個狀態。它既不是拒绝,也不是惩罚,只說明一件事:搜尋引擎知道這個 URL 存在,但還没有安排抓取它。理解這個狀態之前,先要把它和另一個狀態分開看。
两個狀態不要混為一谈
已發現,尚未抓取
URL 已经被發現,来源可能是内鏈、sitemap、外鏈或提交接口。它已经進入待抓取队列,但抓取還没有發生。决定它什么时候被真正抓取的,是站点的抓取配額和這個 URL 的相對優先級。
已抓取,尚未编入索引
這一狀態說明爬虫已经取回了頁面内容,但還没有把它放進可检索的索引。問题從“要不要来抓”變成了“内容值不值得收”,排查方向完全不同。把两者当成一回事,很容易改错東西——明明是内容問题,却反复去提交 sitemap。
积压通常来自哪里
抓取配額不是固定的,它與站点整体质量、响應速度和歷史抓取表現有關。常见的积压来源有:
- 站点在短期内新增了大量 URL,尤其是參數、篩選、分頁带来的组合頁;
- 服務器响應偏慢,或频繁出現 5xx、429,爬虫會主動降低抓取频率;
- 大量低價值頁面占用了名額,真正重要的頁面排在後面;
- 頁面之間缺少稳定的内鏈路径,只能靠 sitemap 被發現,優先級偏低;
- URL 反复變化,同一内容产生多份地址,稀释了抓取预算。
按這個顺序消化
- 先確認這些 URL 是否真的需要被收錄。篩選頁、排序頁、站内搜尋结果頁、带會话參數的頁面,多數情况下不值得占用抓取配額。先收敛它們,比催抓取更有效。
- 检查服務器與响應表現。翻服務端日誌,看抓取請求的返回碼分布。如果 5xx 或 429 占比不低,先修服務端,再谈收錄。
- 控制新 URL 的产生速度。一次性放出几萬個地址,抓取队列大概率會积压。分批發,观察一轮再繼續。
- 用内鏈给出優先級。重要頁面應能從首頁在少數几次点击内到達,並且在相關頁面里有自然的連結入口。只放在 sitemap 里的頁面,通常排在队列後面。
- 提升頁面本身的可抓價值。抓取预算是有限资源,爬虫更愿意把時間花在内容完整、结构清晰、更新有意义的頁面上。
- 用日誌驗證,而不是靠感觉。看指定 URL 是否真的出現了抓取记錄,再判断下一步動作。
不建议做的几件事
反复提交 sitemap、批量推送接口並不會凭空增加配額,短時間内重复操作反而可能被当成低质量信号。也尽量不要為了催收錄去堆砌内鏈,或者把同一批 URL 換着參數反复提交。
抓取积压更像一個排队問题,而不是一個開關問题。排队顺序由站点的整体表現决定,改一两個頁面很难立刻看到變化。
观察什么指标
比較有用的观察對象是:抓取請求的日均次數、返回碼分布、抓取到的 URL 類型占比,以及重要頁面的實际抓取間隔。如果一段時間里抓取總量稳定、错誤率下降、重要頁面的抓取間隔缩短,說明方向是對的;至于积压的存量,通常需要按周甚至按月来观察變化。
回到最初的判断:先分清是“没被安排抓取”還是“抓了但没收”,再决定是去减少低價值 URL,還是去改内容质量。顺序错了,花的時間會很多,動静却很小。