在搜尋资源平台或 Search Console 的頁面报表里,常會看到几種狀態:已發現但尚未抓取、已抓取但尚未编入索引、已编入索引。很多人把它們统称為“没收錄”,然後统一去提交 URL、加外鏈。動作做了不少,效果却不明顯,因為這三個狀態的卡点並不在同一個环节。
三個狀態分別卡在哪
已發現,尚未抓取:搜尋引擎知道這個 URL 存在,但還没安排蜘蛛来抓。它卡在“發現到抓取”之間。常见原因包括站内連結太少、URL 藏在深层次、站点地图只提交未驗證、服務器响應慢、抓取预算被大量低價值頁面占用。
已抓取,尚未编入索引:蜘蛛已经来過,也拿到了頁面内容,但索引系統没有把它收進去。它卡在“抓取到索引”之間。這时候再反复提交 URL 意义不大,問题更可能在頁面本身:内容是否太薄、是否與已有頁面高度相似、canonical 是否指错、是否被 noindex、主要内容是否依赖 JS 渲染而未被执行。
已编入索引:頁面已经進入索引,但這不等于會在搜尋结果里出現。它還要過查询匹配、排序竞争、时效性等關口。收錄是展示的前提,不是展示的保證。
已發現未抓取:先解决蜘蛛来的路径
這個阶段要做的,是让頁面更容易被走到。可以從几個方向查:
- 站内是否给目标頁面留了可点击的入口,還是只能靠站点地图。
- URL 层級是否過深,重要頁面是否被埋在篩選參數或分頁後面。
- 站点地图是否只包含最终規范地址,是否混入大量重定向、404 或 noindex 地址。
- 服務器是否稳定,是否存在大量超时或 5xx,拖慢整体抓取。
- robots.txt 是否誤屏蔽了關键目錄,或屏蔽了 CSS、JS 導致蜘蛛無法正常理解頁面。
這些動作的共同点是:不直接改内容,而是改善 URL 被發現和被安排的效率。若站点里同时存在大量無收錄價值的頁面,它們會分走抓取频次,目标頁面自然排得更後。
已抓取未编入索引:問题回到頁面與重复關系
蜘蛛来過却不收,通常說明索引系統在判断“這個頁面值不值得單獨占一個位置”。常见排查点包括:
- 内容厚度:頁面是否有足够的主体信息,還是只有标题、几張图、一句說明。
- 重复與近似:同一内容是否存在多個 URL 版本,參數、排序、打印頁、标簽頁是否都在竞争同一個位置。
- canonical:頁面是否把規范地址指向了別的頁面,導致自己被当成副本。
- 索引指令:是否誤加了 noindex,或通過响應头、meta 标簽、JS 動態修改了索引指令。
- 渲染结果:正文是否依赖客戶端渲染,蜘蛛抓取时是否拿到了空壳。
這個阶段改内容、合並重复、修正規范地址,比反复提交 URL 更直接。如果頁面本身只是功能頁、過渡頁或占位頁,不收錄可能是正常结果,不必强行推。
已编入索引但搜尋找不到:那是展示問题
頁面進入索引後,搜尋表現還取决于查询意图、竞争程度和頁面與查询的相關性。收錄只說明頁面有资格參與,不說明它一定能被看到。此时應该看的是關鍵詞覆盖、标题和摘要的匹配度、内頁在站内的權重,而不是繼續围绕“收錄”做動作。
處理顺序:從上游往下游走
- 先確認頁面處于哪個狀態,不要把所有未展示都当成未收錄。
- 若卡在“已發現未抓取”,優先修抓取路径和站内入口。
- 若卡在“已抓取未编入索引”,優先看内容质量、重复關系和索引指令。
- 若已经编入索引,轉向展示與排序問题,检查查询匹配和竞争頁面。
同一個“没收錄”的说法,背後可能是三種完全不同的卡点。先分清狀態,再决定是推 URL、改内容,還是收口重复頁面。
把狀態拆開之後,動作會更有针對性,也更容易判断到底是抓取环节没到位,還是頁面本身没通過索引篩選。