打開 GSC 的頁面索引报告,最上面那格“已编入索引”往往不是重点。真正有信息量的,是下面一長串未编入索引里的狀態词。這些词看着像结论,其實只是流程走到哪一步的记錄。把它当成线索而不是判决,排查方向會清楚很多。
狀態词對應的是流程里的位置
一個 URL 從被發現到出現在搜尋结果里,大致要過几步:被連結或 sitemap 暴露出来(發現)→ 蜘蛛真的来請求(抓取)→ 拿到 HTML 並执行脚本(渲染)→ 系統判断這個頁面该不该留、和別的頁面比谁更能代表這個话题(索引選擇)。报告里的狀態词,基本都能塞進這四步里的某一步。
已發現,但尚未编入索引
意思是蜘蛛知道這個地址存在,但還没来抓,或者来了之後排不進队列。常见于几種情况:
- URL 只出現在 sitemap 里,站内没有可点的連結指向它;
- 站点整体抓取份額有限,蜘蛛把時間優先花在更新频繁、權重更高的目錄上;
- 同一批自動生成的頁面數量太大,短時間内消化不完。
這时候反复提交 sitemap 意义不大,更该做的是给關键頁面补内鏈入口,让它們從“列表里的一行”變成“爬行路径上的一站”。數量特別大的模板頁,也可以先想想是不是真的都需要留在索引里。
已抓取,但尚未编入索引
這一步更值得琢磨。蜘蛛已经拿到頁面,内容也看了,最後却没放進索引。常见原因:
- 正文太薄,或大部分内容来自模板,獨立信息量不足;
- 正文要靠 JavaScript 执行後才出現,渲染环节没拿到同样的内容;
- 和站内其他頁面高度相似,系統認為多留一條没有增益。
排查时別只盯着這一個 URL,把同模板的几十條一起打開對比,通常能看出是模板层面的問题,還是個別頁面的問题。
“已排除”下面還分好几種
這個大類里混着完全不同的情况,不能一起處理:
- 被 noindex 排除:自己寫的指令,属于预期结果;
- 备用網頁(有規范的替代頁面):canonical 或系統判断指向了另一個 URL,要確認那個目标是不是你想保留的;
- 重复網頁,未選擇規范版本:重点看規范版本選得對不對;
- 软 404:返回 200 但内容接近空頁,常见于先删内容没處理狀態碼;
- 已找到但無法抓取 / 被 robots.txt 阻止:指令或規則挡住了蜘蛛;
- 404 與重定向:多半是正常狀態,前者說明地址已不存在,後者說明跳轉生效。
把它們分開看,真正需要動手的其實只有其中几類。
几個看报告的习惯
- 按目錄或模板分组看,比盯總量有用。某一類模板集体出状况,和散落几個 URL 的含义完全不同。
- 看趋势,不看某一天的抖動。索引本来就有正常的進出。
- 点開“示例網址”實际打開頁面看一眼,很多問题打開就明白了。
- 有條件的话和服務器日誌對照,確認狀態是“没抓”還是“抓了没留”。
狀態词描述的是结果,不是原因。它告诉你卡在哪一步,剩下的要靠看頁面、看連結、看日誌。
最後一句:报告是仪表盘,不是任務清單。哪些狀態需要處理,取决于這個頁面本身值不值得留在索引里——先回答這個問题,再决定要不要為它折腾。