两個狀態,卡点完全不同
在站点後台的頁面报告中,「已發現 - 尚未编入索引」和「已抓取 - 尚未编入索引」经常被放在一起看,甚至被当成同一件事。但它們的含义差別很大:
- 已發現但未编入索引:搜尋引擎知道這個 URL 存在,通常来自内鏈、sitemap 或外部連結,但還没有真正来抓,或者只抓了一部分。問题出在抓取环节。
- 已抓取但未编入索引:頁面已经被抓取過,内容也拿到了,但经過處理後没有被放進索引。問题出在處理與選擇环节。
分不清這两者,排查方向很容易跑偏:明明是抓取没排上队,却反复去改正文;明明是内容重复導致没被采用,却一直加内鏈。
卡在「已發現」:先解决抓取能不能發生
這一层的核心問题是蜘蛛還没来,或者来得太少。按下面的顺序看:
- 服務器與响應:是否有大量超时、5xx、连接被拒。抓取资源被错誤頁消耗,正常頁面自然排不上。
- robots.txt 與抓取限制:是否誤拦了路径,或抓取频次被压得很低。
- 内鏈入口數量:只有一两個入口、還埋在深层列表里的 URL,被發現和被安排的優先級通常更低。
- sitemap 质量:地址是否可訪問、是否混入重定向和错誤頁、是否長期不更新。
- 站点整体抓取額度:大量低價值 URL 長期占用額度时,新頁面會更晚被安排。
這一层修好後,狀態往往會先變成「已抓取」,然後再進入下一步的判断。
卡在「已抓取」:問题在頁面本身
已经被抓過却進不了索引,說明抓取這一步没障碍,需要看頁面是否值得被保留。常见原因:
- 内容偏薄或缺少獨立信息:同一模板下大量頁面只換了标题和几個字段。
- 與站内其他頁面高度相似:需要先選出代表頁,其余頁面考虑合並、加 noindex 或調整定位。
- 規范地址不清晰或被指向別處:canonical 指到了一個自己也没有進索引的地址。
- 正文靠脚本渲染:抓到的 HTML 里没有實质内容。
- 狀態與内容不一致:返回 200,頁面却寫着已下架、已結束。
- 頁面類型本身不适合索引:篩選结果、排序參數、分頁尾頁等。
先分组,再决定改什么
不要拿全站收錄率直接下结论。按模板把 URL 分成几组,比如文章頁、商品頁、标簽頁、篩選頁、分頁,分別算每组里两個狀態各占多少。常见的局面是:整体收錄率不高,但文章頁其實正常,拖後腿的是篩選頁和标簽頁。這種情况下,調模板比改正文更有效。
處理顺序上的一個原則
先解决「已發現」,再看「已抓取」。抓取都没發生的时候,讨论内容质量意义不大,因為搜尋引擎還没看過這些頁面。反過来,如果大量頁面已经抓取過却迟迟不進索引,繼續加内鏈、提抓取频次,通常也不會有明顯變化。
抓取、處理、索引是三個环节,任何一环停下,都會在报告里表現為「没收錄」,但原因並不相同。修复動作要對應到真正卡住的那一环。
建议做一個简單的狀態表
按周记錄:每個模板分组的 URL 總數、已發現數、已抓取未索引數、已索引數,以及当周做過的改動。几周下来就能看出,某個動作之後是哪一层狀態在移動。這比反复猜原因要可靠,也能避免在收錄没有立刻變化时,過早否定一個本来正确的調整。