在索引覆盖率报告里,除了“已抓取,尚未编入索引”,還有一個常被忽略的狀態:“已發現,尚未抓取”。它說明搜尋引擎已经知道這個 URL 存在,可能来自站点地图、内鏈或外部連結,但抓取队列還没有轮到它。這两個狀態的原因和應對方式並不相同,混在一起看,很容易做错動作。
“已發現”和“已抓取”分別卡在哪一步
“已發現”發生在抓取之前。搜尋引擎知道有這么一個地址,但還没有實际請求頁面内容。此时頁面质量、關鍵詞、正文结构都還没有被评估過,因為爬虫根本没讀到。“已抓取,尚未编入索引”則是已经讀過了,只是在索引阶段被判断為暂时不值得收錄。把後者的問题当成前者来處理,比如反复改标题、加内鏈,方向就偏了。
URL 停在“已發現”的常见原因
- 抓取资源有限。 站点越大、更新越频繁,爬虫在一次訪問中能請求的頁面數量就越受限制。低優先級 URL 會一直排队。
- 站点整体响應偏慢。 服務器响應時間、超时比例、5xx 错誤都會让爬虫降低抓取频率,队列消化得更慢。
- URL 只出現在站点地图里。 站点地图能帮助發現地址,但如果站内没有任何可点击的入口,爬虫對它的重视程度通常有限。
- 同類 URL 一次性提交太多。 批量生成的标簽頁、篩選頁、參數頁都塞進站点地图,會把真正重要的頁面挤到後面。
- 站点本身較新或權重較低。 新站点的抓取配額通常需要時間积累,早期排队明顯是正常現象。
自查顺序:從能控制的地方開始
- 先確認 URL 可以直接訪問,返回 200,且没有跳轉鏈或登入墙。
- 检查 robots.txt 是否誤屏蔽了该路径,以及頁面是否有 noindex。這两個問题會让抓取和收錄都失去意义。
- 查看服務器日誌或监控中的响應時間,確認没有大面积超时或 5xx。
- 從首頁或栏目頁出發,確認這個頁面能在少數几次点击内到達,而不是只能通過站点地图找到。
- 检查站点地图中提交的 URL 數量與质量,把參數頁、重复頁和低價值頁去掉,让重点頁面排前面。
- 观察一段時間,看“已發現”的數量是缓慢下降還是持續堆积。持續堆积通常意味着抓取预算被低质 URL 消耗了。
收錄是抓取、评估之後的结果,不是提交之後立刻發生的動作。能做的通常是减少干扰,而不是催促。
容易做反的几個動作
- 把所有頁面都加進站点地图,希望“提交了就抓”。站点地图是發現工具,不是抓取指令。
- 用推送接口反复提交同一批低质頁面。推送能缩短發現時間,但不會提高頁面的抓取優先級。
- 為了“让爬虫多来”而大量生成新頁面。頁面越多,分摊到每個 URL 的抓取配額往往越少。
- 只盯着“已發現”的數量,不看這些 URL 是否本来就不该被收錄。有些頁面留在队列里反而更合适。
和“已抓取,尚未编入索引”的区別
如果狀態已经變成“已抓取,尚未编入索引”,說明抓取這一關過了,問题更可能出在内容质量、重复度、頁面体驗或站点整体信任度上。此时该查的是正文是否完整、是否與站内其他頁面高度相似、是否有明确的主题,而不是繼續優化抓取入口。反過来,如果 URL 一直停在“已發現”,先別急着改内容,優先處理可訪問性、内鏈和站点地图的取舍。
两種狀態可以同时出現在一個站点里,也可以随着時間互相轉換。建议按周观察趋势,而不是每天看單條 URL。把關注点放在“重要頁面是否被稳定抓取和收錄”上,比追求覆盖率报告里的某個數字更有意义。