打開索引覆盖率报告,红色和灰色往往比绿色更吸引注意力。但“已排除”不是一張错誤清單,它把正常狀態和真正的問题混在了一起。逐條讀之前,先想清楚這個頁面本来该不该進索引。
先分清“错誤”和“已排除”
报告通常把结果分成两類:一類是错誤,比如服務器返回 5xx、被 robots.txt 拦截;另一類是已排除,意思是系統主動决定不收,或者還在等待處理。前者多半需要修,後者要看具体情况。把两者当成同一件事,很容易白忙一场。
另外,同一個狀態在不同站点上的含义並不一样。一個电商站有几萬個篩選參數頁被排除,是正常現象;一個只有二十頁的企业站出現同样數量,就值得查一下是不是 URL 生成出了問题。
几類常见的排除原因
- 已發現,尚未抓取:URL 被知道了,但還没轮到抓。數量不多、能被正常抓到的頁面,等一等通常會自己走完;如果長期不動,再看抓取频次和站内入口。
- 已抓取,尚未编入索引:抓到了但没進索引。常见原因包括内容與站内或站外其他頁面高度相似、頁面本身信息量太薄、頁面還在較新的观察期。
- 重复網頁,系統選擇的規范頁與用戶指定的不同:你寫了 canonical,但搜尋引擎選了另一個 URL。先別急着改标簽,看看被選中的那個是不是内容更完整、入口更多的版本。
- 备用網頁(有适当的規范标记):這是正常狀態,說明規范關系被识別了,不必處理。
- 被 noindex 排除:确實是你自己要求不收的。要確認的是這個指令该不该出現在這個頁面上,而不是它為什么生效。
- 已找到,但目前未编入索引:多见于结构較深、内鏈較少、或站点整体權重有限的頁面。
按什么顺序排查
- 先判断頁面價值。打開頁面自己看一眼:它有没有獨立信息,用戶從站内能不能走到,标题和正文是否说得清自己是什么。這一步過不了,後面都是绕路。
- 再看抓取层面。用日誌或抓取工具確認搜尋引擎到底有没有来過、返回了什么狀態碼、渲染後看到的内容和用戶看到的是否一致。
- 然後看内容與重复。對比站内相近頁面,找出真正的主版本,其余版本要么合並、要么明确規范指向。
- 最後看技術指令。检查 meta robots、X-Robots-Tag、robots.txt、canonical 是否互相矛盾。矛盾时,先简化,只保留一條明确指令。
两個容易誤判的地方
一是把“已發現,尚未抓取”当成收錄失敗。URL 的發現和抓取之間本来就有時間差,尤其是新站或頁面數量突然增加时,這個數字會先涨後落。
二是看到“已抓取,尚未编入索引”就反复改标题、改正文。如果頁面本身和站内另一頁几乎一样,改措辞没用,要處理的是重复關系本身。
別為了让灰色數字變绿,把本来不该被收錄的頁面硬塞進去。索引里多一個低质量頁面,通常不是收益,而是负担。