網站收錄

已發現但尚未编入索引:這個中間狀態卡住时该检查什么

索引覆盖率报告里,“已發現”和“已抓取”常被混為一谈。本文解释這两個狀態分別代表蜘蛛知道了地址、還是已经訪問過頁面,並给出卡在中間狀態时的排查顺序:先看内鏈和抓取入口,再检查内容獨特性、重复度、canonical 和 URL 規范,最後說明哪些頁面主動挡住收錄更合理。

網站收錄

已發現但尚未编入索引:這個中間狀態卡住时该检查什么

在搜尋引擎的索引覆盖率报告里,URL 的狀態通常不止“已收錄”和“未收錄”两種。很多站点會看到一批頁面停在“已發現——尚未编入索引”“已抓取——尚未编入索引”。這两個狀態不是错誤,但它們說明蜘蛛已经知道這個地址,却没有把它放進可展現的索引里。理解它們之間的差別,有助于判断下一步该優化抓取還是優化頁面本身。

“已發現”和“已抓取”分別代表什么

“已發現”通常意味着搜尋引擎從某個入口拿到了這個 URL,比如站内連結、sitemap、外鏈或提交接口。但蜘蛛還没有真正訪問這個地址。它可能只是被记錄進了待抓取队列。

“已抓取”則說明蜘蛛已经訪問過頁面,拿到了 HTML 或至少一部分响應内容,但索引系統在评估後没有把它收錄。原因可能出在内容质量、重复度、頁面價值判断,或者索引策略上。

简單说:已發現是“知道有這個地方”,已抓取是“已经来看過”,编入索引是“决定把它放進可搜尋的库”。三者不是一回事。

卡在“已發現”时,先看抓取入口和抓取预算

如果大量 URL 長期停在“已發現”,蜘蛛可能没有足够動力或机會来抓。常见原因有:

  • 頁面没有站内連結指向,只能靠 sitemap 被發現,但 sitemap 里的地址很多,蜘蛛来不及逐個訪問。
  • 站点整体抓取预算被低價值頁面占用,比如參數頁、篩選頁、重复列表頁消耗了抓取频次。
  • 服務器响應慢或经常超时,蜘蛛會降低回訪频率。
  • robots.txt 没有直接屏蔽,但抓取速率被限制得很低。

這时候可以把重点放在内鏈结构抓取入口上:让重要頁面從首頁或栏目頁有几层可点的連結,减少孤立 URL;清理或屏蔽明顯低價值的參數组合;检查服務器日誌,看蜘蛛實际訪問了哪些目錄,哪些目錄一直没被碰過。

卡在“已抓取”时,重点轉向頁面质量和重复度

蜘蛛来過却没有收錄,問题通常不在“能不能抓”,而在“值不值得收”。可以從几個方向排查:

  1. 頁面主体内容是否太少。如果正文只有几句话,其余是導航、推荐、广告和版權信息,索引系統可能認為頁面没有足够獨特的信息。
  2. 是否與其他頁面高度重复。同一套内容通過不同參數、不同排序方式生成多個 URL,或者商品描述直接複製供應商资料,都容易让頁面互相稀释。
  3. 标题和摘要是否模板化。大量頁面共用同一标题格式,缺少具体描述,索引系統难以判断每個頁面的差异。
  4. 頁面是否主要靠 JS 渲染。如果核心内容在客戶端渲染後才出現,而蜘蛛拿到的初始 HTML 里没有實质内容,也可能影响判断。
  5. 是否有 noindex 或 canonical 指向別處。已抓取但未编入索引,有时是因為頁面自己声明了不收錄,或者 canonical 指到了另一個 URL。

這些因素不一定單獨起作用,但通常會叠加。比如一個頁面内容少、标题模板化、又和別的頁面重复,那么即使被抓取,也很难進入索引。

URL 規范和站点结构也會影响狀態流轉

同一個頁面如果有多個可訪問地址,比如带 www 和不带 www、带尾斜杠和不带尾斜杠、大小寫混用,蜘蛛可能分別抓取,但索引系統只選擇其中一個作為規范版本。其他版本就容易停在“已抓取——尚未编入索引”或“重复網頁,選擇的規范網頁不同”。

建议统一 URL 規則,並用 301 把非規范版本指向規范版本。同时检查站内連結是否混用了不同寫法,避免自己把蜘蛛引向多個入口。

處理顺序可以這样安排

  1. 先看日誌和索引报告,区分是“已發現”多還是“已抓取未收錄”多。
  2. 如果是“已發現”多,優先补内鏈、精简 sitemap、降低低價值頁面的抓取消耗。
  3. 如果是“已抓取”多,優先检查這些頁面的正文獨特性、重复度、标题摘要和 canonical 設定。
  4. 對確認無收錄價值的頁面,用 noindex 或 robots.txt 明确處理,避免繼續占用抓取资源。
  5. 改動後观察一段時間,不要频繁反复修改,给蜘蛛重新评估留出周期。

索引狀態是结果,不是原因。把抓取入口、頁面质量和 URL 規范這三件事理顺,中間狀態通常會慢慢减少。但也要接受一個事實:不是所有被發現的 URL 都值得被收錄,有些頁面主動挡在索引之外反而更合理。