站点收錄出問题时,很多人第一件事是打開搜尋後台的覆盖率报告,看到某個狀態就下结论:一定是内容质量差,或者一定是被降權。實际上這份报告给出的是過程狀態,不是原因判断。同一個狀態背後可能有好几種原因,處理方式也完全不同。
先把狀態分成两類
报告里的狀態名有几十種,粗分其實只有两類:一類是“還没轮到”,一類是“被明确拒绝”。前者要改善抓取路径和頁面價值,後者要先確認排除是不是自己设的。
- 還没轮到:已發現尚未编入索引、已抓取尚未编入索引。URL 已经被系統知道,只是還没走完流程。
- 被拒绝或被替換:被 noindex 排除、被 robots.txt 拦截、重复網頁(系統選了另一個規范頁)、备用網頁、软 404。
混淆這两類的後果很常见:把“還没轮到”当成惩罚,急着改内容;把“被替換”当成抓取不够,拼命加内鏈。
几個高频狀態的實际含义
已發現,尚未编入索引
系統知道了這個 URL,但還没抓,或者抓它的優先級很低。常见于新站、内鏈很少的深层頁面、批量生成頁面的尾部。要處理的是抓取入口:有没有從首頁几跳之内点到、sitemap 里是否正确列出、站内是否存在大量低價值 URL 把抓取分走了。
已抓取,尚未编入索引
頁面已经被抓下来了,但没有進入索引。這时抓取不再是瓶颈,要看頁面本身:内容是否與站内其他頁面高度相似、是否只是參數或列表的组合、正文是否薄到没有可索引的獨立信息。這種情况下繼續重复提交 URL 意义不大。
重复網頁,系統選擇了不同的規范網頁
你指定的 canonical 和系統判断的規范頁不一致。常见原因是两頁内容确實很像,或者你指定的那個頁面本身有 noindex、被拦截、返回错誤。先確認目标頁可正常訪問且允许索引,再回头看内容相似度。
被 noindex、被 robots 拦截
這類是明确排除,第一步是確認排除是不是自己设的。測試环境遗留的 meta noindex、誤寫進 robots.txt 的目錄,都會造成大面积“已排除”。
备用網頁、软 404
备用網頁多數與移動端版本或重复版本有關,通常不需要單獨處理,但值得確認主版本有没有被收錄。软 404 是返回 200 却没有實际内容的頁面,需要判断是补齐内容還是合並到其他頁面。
报告告诉你卡在哪一步,不會告诉你為什么。原因要從頁面本身、内鏈路径和站点结构里找,只看狀態名稱容易走偏。
按顺序自查,別跳步
- 確認 URL 能正常打開,返回 200,且不是跳轉鏈的中間地址。
- 確認没有被 robots.txt、meta noindex、X-Robots-Tag 挡住,也没有被登入或地域限制挡住。
- 看這個 URL 從站内能不能点到,路径有几跳,有没有稳定的入口。
- 和同類型已经收錄的頁面比一比:结构相近、長度相近,為什么一個進了索引另一個没進。
- 確認頁面對用戶有獨立價值,不是為凑數量而生成的。
- 以上都正常,再考虑提交或繼續等待,並给自己定一個观察周期。
几個容易踩的坑
- 把报告当實时資料,每天盯着一两個 URL 反复看。报告本身有延迟,短期變化說明不了什么。
- 看到“未编入索引”就删頁面或改标题。先分清是頁面問题還是入口問题。
- 只提交 sitemap,不修内鏈。sitemap 能帮助發現 URL,但替代不了站内结构。
- 把收錄当成目标本身。收錄只是结果,頁面能不能解决問题才是它留下来的理由。
狀態名只是一個方向标。顺着“能不能抓、抓了值不值得留、留下来會不會和別的内容打架”這條线走,比對着狀態名猜原因要靠谱得多。