網站收錄

已發現、已抓取、已收錄:三個狀態別用同一套動作

在收錄报表里,“已發現未抓取”“已抓取未编入索引”“已编入索引”常被混在一起看。其實三者卡点不同:前者看抓取路径,中者看頁面质量與重复關系,後者才轮到展示竞争。本文把三種狀態拆開,给出對應的排查顺序和動作,避免用错力。

網站收錄

已發現、已抓取、已收錄:三個狀態別用同一套動作

在搜尋资源平台或 Search Console 的頁面报表里,常會看到几種狀態:已發現但尚未抓取、已抓取但尚未编入索引、已编入索引。很多人把它們统称為“没收錄”,然後统一去提交 URL、加外鏈。動作做了不少,效果却不明顯,因為這三個狀態的卡点並不在同一個环节。

三個狀態分別卡在哪

已發現,尚未抓取:搜尋引擎知道這個 URL 存在,但還没安排蜘蛛来抓。它卡在“發現到抓取”之間。常见原因包括站内連結太少、URL 藏在深层次、站点地图只提交未驗證、服務器响應慢、抓取预算被大量低價值頁面占用。

已抓取,尚未编入索引:蜘蛛已经来過,也拿到了頁面内容,但索引系統没有把它收進去。它卡在“抓取到索引”之間。這时候再反复提交 URL 意义不大,問题更可能在頁面本身:内容是否太薄、是否與已有頁面高度相似、canonical 是否指错、是否被 noindex、主要内容是否依赖 JS 渲染而未被执行。

已编入索引:頁面已经進入索引,但這不等于會在搜尋结果里出現。它還要過查询匹配、排序竞争、时效性等關口。收錄是展示的前提,不是展示的保證。

已發現未抓取:先解决蜘蛛来的路径

這個阶段要做的,是让頁面更容易被走到。可以從几個方向查:

  • 站内是否给目标頁面留了可点击的入口,還是只能靠站点地图。
  • URL 层級是否過深,重要頁面是否被埋在篩選參數或分頁後面。
  • 站点地图是否只包含最终規范地址,是否混入大量重定向、404 或 noindex 地址。
  • 服務器是否稳定,是否存在大量超时或 5xx,拖慢整体抓取。
  • robots.txt 是否誤屏蔽了關键目錄,或屏蔽了 CSS、JS 導致蜘蛛無法正常理解頁面。

這些動作的共同点是:不直接改内容,而是改善 URL 被發現和被安排的效率。若站点里同时存在大量無收錄價值的頁面,它們會分走抓取频次,目标頁面自然排得更後。

已抓取未编入索引:問题回到頁面與重复關系

蜘蛛来過却不收,通常說明索引系統在判断“這個頁面值不值得單獨占一個位置”。常见排查点包括:

  • 内容厚度:頁面是否有足够的主体信息,還是只有标题、几張图、一句說明。
  • 重复與近似:同一内容是否存在多個 URL 版本,參數、排序、打印頁、标簽頁是否都在竞争同一個位置。
  • canonical:頁面是否把規范地址指向了別的頁面,導致自己被当成副本。
  • 索引指令:是否誤加了 noindex,或通過响應头、meta 标簽、JS 動態修改了索引指令。
  • 渲染结果:正文是否依赖客戶端渲染,蜘蛛抓取时是否拿到了空壳。

這個阶段改内容、合並重复、修正規范地址,比反复提交 URL 更直接。如果頁面本身只是功能頁、過渡頁或占位頁,不收錄可能是正常结果,不必强行推。

已编入索引但搜尋找不到:那是展示問题

頁面進入索引後,搜尋表現還取决于查询意图、竞争程度和頁面與查询的相關性。收錄只說明頁面有资格參與,不說明它一定能被看到。此时應该看的是關鍵詞覆盖、标题和摘要的匹配度、内頁在站内的權重,而不是繼續围绕“收錄”做動作。

處理顺序:從上游往下游走

  1. 先確認頁面處于哪個狀態,不要把所有未展示都当成未收錄。
  2. 若卡在“已發現未抓取”,優先修抓取路径和站内入口。
  3. 若卡在“已抓取未编入索引”,優先看内容质量、重复關系和索引指令。
  4. 若已经编入索引,轉向展示與排序問题,检查查询匹配和竞争頁面。
同一個“没收錄”的说法,背後可能是三種完全不同的卡点。先分清狀態,再决定是推 URL、改内容,還是收口重复頁面。

把狀態拆開之後,動作會更有针對性,也更容易判断到底是抓取环节没到位,還是頁面本身没通過索引篩選。