網站收錄

收錄狀態里的“已發現”“已抓取”“已排除”:分別卡在哪一步

頁面索引报告里的狀態词看起来像结论,其實只是流程记錄。本文把“已發現”“已抓取”“已排除”拆回 URL 發現、抓取、渲染和索引選擇這几步,说清哪些狀態属于预期结果,哪些值得打開頁面、對照日誌去排查。

網站收錄

收錄狀態里的“已發現”“已抓取”“已排除”:分別卡在哪一步

打開 GSC 的頁面索引报告,最上面那格“已编入索引”往往不是重点。真正有信息量的,是下面一長串未编入索引里的狀態词。這些词看着像结论,其實只是流程走到哪一步的记錄。把它当成线索而不是判决,排查方向會清楚很多。

狀態词對應的是流程里的位置

一個 URL 從被發現到出現在搜尋结果里,大致要過几步:被連結或 sitemap 暴露出来(發現)→ 蜘蛛真的来請求(抓取)→ 拿到 HTML 並执行脚本(渲染)→ 系統判断這個頁面该不该留、和別的頁面比谁更能代表這個话题(索引選擇)。报告里的狀態词,基本都能塞進這四步里的某一步。

已發現,但尚未编入索引

意思是蜘蛛知道這個地址存在,但還没来抓,或者来了之後排不進队列。常见于几種情况:

  • URL 只出現在 sitemap 里,站内没有可点的連結指向它;
  • 站点整体抓取份額有限,蜘蛛把時間優先花在更新频繁、權重更高的目錄上;
  • 同一批自動生成的頁面數量太大,短時間内消化不完。

這时候反复提交 sitemap 意义不大,更该做的是给關键頁面补内鏈入口,让它們從“列表里的一行”變成“爬行路径上的一站”。數量特別大的模板頁,也可以先想想是不是真的都需要留在索引里。

已抓取,但尚未编入索引

這一步更值得琢磨。蜘蛛已经拿到頁面,内容也看了,最後却没放進索引。常见原因:

  • 正文太薄,或大部分内容来自模板,獨立信息量不足;
  • 正文要靠 JavaScript 执行後才出現,渲染环节没拿到同样的内容;
  • 和站内其他頁面高度相似,系統認為多留一條没有增益。

排查时別只盯着這一個 URL,把同模板的几十條一起打開對比,通常能看出是模板层面的問题,還是個別頁面的問题。

“已排除”下面還分好几種

這個大類里混着完全不同的情况,不能一起處理:

  • 被 noindex 排除:自己寫的指令,属于预期结果;
  • 备用網頁(有規范的替代頁面):canonical 或系統判断指向了另一個 URL,要確認那個目标是不是你想保留的;
  • 重复網頁,未選擇規范版本:重点看規范版本選得對不對;
  • 软 404:返回 200 但内容接近空頁,常见于先删内容没處理狀態碼;
  • 已找到但無法抓取 / 被 robots.txt 阻止:指令或規則挡住了蜘蛛;
  • 404 與重定向:多半是正常狀態,前者說明地址已不存在,後者說明跳轉生效。

把它們分開看,真正需要動手的其實只有其中几類。

几個看报告的习惯

  1. 按目錄或模板分组看,比盯總量有用。某一類模板集体出状况,和散落几個 URL 的含义完全不同。
  2. 看趋势,不看某一天的抖動。索引本来就有正常的進出。
  3. 点開“示例網址”實际打開頁面看一眼,很多問题打開就明白了。
  4. 有條件的话和服務器日誌對照,確認狀態是“没抓”還是“抓了没留”。
狀態词描述的是结果,不是原因。它告诉你卡在哪一步,剩下的要靠看頁面、看連結、看日誌。

最後一句:报告是仪表盘,不是任務清單。哪些狀態需要處理,取决于這個頁面本身值不值得留在索引里——先回答這個問题,再决定要不要為它折腾。