在站長平台或搜尋控制台里,“已發現未抓取”和“已抓取未索引”是两個容易混淆的狀態。它們听起来都像“没收錄”,但卡住的位置不一样。弄清区別,排查方向才不會跑偏。
先把两個狀態放回流程里
一個 URL 從被發現到出現在索引里,大致要经過:發現 URL → 排队抓取 → 抓取頁面 → 质量判断 → 進入索引。每個环节都有可能停下来。
- 已發現未抓取:地址已经被搜尋引擎知道,但還没轮到抓取。可能来自 sitemap、内鏈、外鏈或站長平台提交。
- 已抓取未索引:頁面已经被抓取過,但搜尋引擎判断它暂时不值得放進索引,或者有技術信号阻止它進入索引。
- 已排除:通常有明确的指令或規則,比如 noindex、canonical、robots.txt、重复内容合並等。
這里的關键区別是:前者是抓取調度問题,後者是索引决策問题。抓到不等于收錄,發現也不等于马上抓取。
已發現未抓取:多半是排队和優先級問题
如果大量 URL 停在“已發現未抓取”,先不要急着改頁面内容,優先看抓取端。
常见原因
- 站点抓取预算有限:小站或新站,搜尋引擎不會無限抓取,低價值 URL 會排在後面。
- URL 發現渠道太多但质量不齐:sitemap 里堆了大量參數頁、篩選頁、重复地址,真正重要的頁面反而不突出。
- 内鏈太少或太深:頁面只有 sitemap 提到,没有站内点击路径,發現後也容易被放在低優先級。
- 服務器响應慢或频繁超时:抓取队列會绕開不稳定地址。
- 頁面更新频率低:長期不更新的列表頁、归档頁,抓取優先級自然下降。
可以检查什么
- 看抓取日誌,確認蜘蛛最近有没有訪問這些目錄,訪問频率是否下降。
- 检查 sitemap 是否只放了 canonical 地址,是否混入大量參數和重复 URL。
- 给重要頁面增加站内入口,缩短点击深度。
- 观察服務器响應時間,尤其是移動端和動態接口。
- 如果只是少量新頁面,可以等待;如果大批量長期停滞,再考虑精简 URL 總量。
已發現未抓取不等于頁面有問题。它更像排队:URL 太多、入口太杂、優先級不够时,抓取會往後排。
已抓取未索引:問题在抓取之後
這個狀態說明蜘蛛已经来過,但頁面没有進入索引。原因通常更靠近頁面质量和索引規則。
常见原因
- 内容质量判断未通過:正文太少、模板重复、缺少獨立信息。
- 重复内容:站内多個地址内容高度相似,搜尋引擎選擇一個代表版本,其他版本不進索引。
- canonical 指向別處:頁面自己声明了另一個規范地址,索引會集中到目标頁。
- noindex 或 robots 限制:虽然被抓取,但指令明确要求不索引。
- 渲染問题:正文依赖 JavaScript,抓取时只拿到空壳,质量判断拿不到有效内容。
- 软 404:頁面返回 200 但内容像错誤頁、空列表或無结果頁。
可以检查什么
- 先確認頁面是否有 noindex、canonical 指向其他地址。
- 對比被抓取版本和用戶看到的版本,尤其是 JS 渲染内容。
- 检查同站是否有多個 URL 輸出相同或接近的内容。
- 看頁面正文占比,模板和導航是否占了大头。
- 如果頁面属于篩選、排序、分頁參數,判断它是否應该被索引。
两個狀態的排查顺序不一样
遇到“没收錄”时,先分類,再動手。
- 停在“已發現未抓取”:優先查 URL 發現、内鏈、sitemap、抓取预算、服務器稳定性。
- 停在“已抓取未索引”:優先查頁面质量、重复内容、canonical、noindex、渲染结果。
- 如果两邊都有:先處理抓取端,让重要 URL 先被訪問,再看索引端。
把這两個狀態混在一起看,容易出現一種無效操作:頁面明明已经抓取,却反复提交 sitemap;或者頁面根本没被抓取,却一直改正文。先確認卡在哪一段,再决定改什么。
收錄不是單一開關。URL 發現、抓取調度、质量判断和索引選擇是几道不同的门。
日常运营中,可以把“已發現未抓取”和“已抓取未索引”当成两個检查入口。前者看抓取效率,後者看頁面是否值得留下。分開看,排查會清楚很多。