在搜尋控制台的頁面索引报告里,除了“已發現,尚未抓取”和“已编入索引”,還有一類狀態常被忽略:已抓取,尚未编入索引。它和前者不是一回事——蜘蛛已经把頁面拿回去了,只是索引系統没有把這份内容放進去。
三種狀態,卡住的位置不同
- 已發現,尚未抓取:URL 被知道了,蜘蛛還没来,問题出在抓取調度。
- 已抓取,尚未编入索引:内容已经拿回,問题出在索引阶段的判断。
- 已编入索引:進入索引,才有机會出現在结果里,能不能排上去是另一回事。
把這两類混着看,很容易做错動作。前者该改内鏈、改 sitemap、調整抓取優先級;後者再怎么提交 URL,也不會直接改變索引系統的判断。
内容拿回去了,索引為什么不收
1. 頁面没有提供新的東西
常见的情况是同一批頁面结构几乎一样,只換了几個词、商品名或者城市名。索引系統會把它們归成相近的模板頁,留下一部分作為代表,其余的長期停留在已抓取未编入索引。
2. 站内低质頁面占比過高
索引是讲取舍的。当一個目錄下大量頁面本身就不值得收錄时,新頁面被压着不進索引的概率也會變高。這不是單個頁面的問题,而是整体信号在起作用。
3. 正文没被拿到:渲染或结构問题
如果主体内容依赖 JavaScript 才能顯示,或者被折叠、被登入墙挡住,蜘蛛抓到的可能只是一個空壳。狀態看着是已抓取,實际拿到的内容不足以做判断。
4. 刚發布,還在排队
新頁面從抓取到進入索引本身有一段延迟,站点規模大、更新频繁时更明顯。几天内的狀態波動,不必太早下结论。
自查顺序
- 用 URL 检查工具看實际抓取到的 HTML,確認正文是否完整、有没有被脚本挡住。
- 检查規范标簽是否指向自己,有没有誤指向別的 URL,或者被別的頁面反向指定。
- 看同目錄下有多少结构相近的頁面,判断是否存在大量同质内容。
- 確認頁面至少有一條站内可爬到的内鏈,且锚文本能說明它的主题。
- 翻服務器日誌,確認返回碼正常,没有频繁超时或 5xx。
反复点击“請求编入索引”不會加快索引判断,它主要影响的是抓取环节。收不收,取决于頁面本身值不值得留。
可以做和不必做的事
可以做的:补足頁面獨有的信息,把高度相近的頁面合並,或者让各自的差异明确起来;给重要頁面补内鏈;清理長期没有價值、也没人訪問的頁面,降低同质頁面的比例。
不必做的:為凑數量批量生成頁面;短時間内反复提交同一批 URL;把希望寄托在某次抓取之後狀態自己變化。狀態确實會變,但通常是被内容變化推動的。
观察周期建议按周看,不要按天。如果調整之後几周仍停在同一個狀態,就回到内容本身:和已经收錄的頁面相比,它到底提供了什么別人没有的東西。