網站收錄

已抓取,尚未编入索引:蜘蛛讀過了,頁面為什么還没進索引

頁面狀態顯示“已抓取,尚未编入索引”,說明内容已经被拿走,卡住的位置在索引判断,而不是抓取調度。本文区分“已發現未抓取”和“已抓取未编入索引”两種狀態,梳理同质内容、低质頁面占比、渲染不全、新頁面延迟等常见原因,並给出一套自查顺序和可做的調整動作。

網站收錄

已抓取,尚未编入索引:蜘蛛讀過了,頁面為什么還没進索引

在搜尋控制台的頁面索引报告里,除了“已發現,尚未抓取”和“已编入索引”,還有一類狀態常被忽略:已抓取,尚未编入索引。它和前者不是一回事——蜘蛛已经把頁面拿回去了,只是索引系統没有把這份内容放進去。

三種狀態,卡住的位置不同

  • 已發現,尚未抓取:URL 被知道了,蜘蛛還没来,問题出在抓取調度。
  • 已抓取,尚未编入索引:内容已经拿回,問题出在索引阶段的判断。
  • 已编入索引:進入索引,才有机會出現在结果里,能不能排上去是另一回事。

把這两類混着看,很容易做错動作。前者该改内鏈、改 sitemap、調整抓取優先級;後者再怎么提交 URL,也不會直接改變索引系統的判断。

内容拿回去了,索引為什么不收

1. 頁面没有提供新的東西

常见的情况是同一批頁面结构几乎一样,只換了几個词、商品名或者城市名。索引系統會把它們归成相近的模板頁,留下一部分作為代表,其余的長期停留在已抓取未编入索引。

2. 站内低质頁面占比過高

索引是讲取舍的。当一個目錄下大量頁面本身就不值得收錄时,新頁面被压着不進索引的概率也會變高。這不是單個頁面的問题,而是整体信号在起作用。

3. 正文没被拿到:渲染或结构問题

如果主体内容依赖 JavaScript 才能顯示,或者被折叠、被登入墙挡住,蜘蛛抓到的可能只是一個空壳。狀態看着是已抓取,實际拿到的内容不足以做判断。

4. 刚發布,還在排队

新頁面從抓取到進入索引本身有一段延迟,站点規模大、更新频繁时更明顯。几天内的狀態波動,不必太早下结论。

自查顺序

  1. 用 URL 检查工具看實际抓取到的 HTML,確認正文是否完整、有没有被脚本挡住。
  2. 检查規范标簽是否指向自己,有没有誤指向別的 URL,或者被別的頁面反向指定。
  3. 看同目錄下有多少结构相近的頁面,判断是否存在大量同质内容。
  4. 確認頁面至少有一條站内可爬到的内鏈,且锚文本能說明它的主题。
  5. 翻服務器日誌,確認返回碼正常,没有频繁超时或 5xx。
反复点击“請求编入索引”不會加快索引判断,它主要影响的是抓取环节。收不收,取决于頁面本身值不值得留。

可以做和不必做的事

可以做的:补足頁面獨有的信息,把高度相近的頁面合並,或者让各自的差异明确起来;给重要頁面补内鏈;清理長期没有價值、也没人訪問的頁面,降低同质頁面的比例。

不必做的:為凑數量批量生成頁面;短時間内反复提交同一批 URL;把希望寄托在某次抓取之後狀態自己變化。狀態确實會變,但通常是被内容變化推動的。

观察周期建议按周看,不要按天。如果調整之後几周仍停在同一個狀態,就回到内容本身:和已经收錄的頁面相比,它到底提供了什么別人没有的東西。