打開搜尋後台的索引覆盖报告,大多數人第一反應是看“已编入索引”那一栏有多少,然後被旁邊一堆“已排除”吓一跳。實际上,“已排除”只是一個分類标簽,它既包含你主動要求不要收錄的 URL,也包含搜尋引擎自己判断不值得收錄的 URL。把這两者混在一起看,很容易做出错誤改動。
一、“已排除”里哪些是符合预期的
下面這些狀態通常說明系統按你的意图或按常規逻辑處理了頁面,不需要額外動作:
- noindex 标记生效:頁面明确要求不進索引,被排除是正确结果。
- robots.txt 屏蔽:注意屏蔽的是抓取,不是索引;如果頁面已经被收錄,屏蔽反而可能让它以無摘要形式留在结果里。
- canonical 指向其他 URL:同一份内容的多個版本,系統把權重归到你指定的那一版。
- 重复網頁,系統選擇了別的規范頁:這表示你的 canonical 與系統看到的信号不一致,属于需要看一眼的狀態,但不代表頁面本身有問题。
- 替代頁面:移動版、AMP 版、打印版等,主版本被收錄即可。
- 重定向與备用網頁(有規范标记):舊 URL 的常见归宿。
二、容易誤判的几個狀態
已發現但尚未抓取
這不属于“排除”,只是排队。它說明 URL 已经被知道,但抓取资源還没轮到。判断依據是看進入這個狀態的時間和站点整体抓取量,而不是單看數量。
已抓取但尚未编入索引
頁面已经拿回来了,系統在犹豫要不要放進索引。常见原因是内容與站内其他頁高度相似、信息量偏薄、頁面缺少明确主题,或者站点整体可索引的 URL 太多而價值參差。這個狀態最需要看頁面本身,而不是去改 robots 或提交更多 URL。
软 404
返回 200,但内容看起来像空頁、占位頁或错誤提示。系統據此判断頁面没有實质内容。核對方式是看頁面在無參數、無登入狀態下返回的正文是否完整。
重复網頁,用戶選擇的規范網頁與系統選擇的不同
這是最值得看的一條。它說明頁面上的 canonical、内鏈、站点地图、歷史收錄之間存在冲突,系統選了另一邊。要么把信号统一,要么接受系統的選擇。
三、建议的核對顺序
- 先看 URL 自身:返回碼是否稳定為 200,是否有 noindex,canonical 指向哪里。
- 再看 robots.txt 與抓取情况:是不是被拦住了,蜘蛛是否真的来過。
- 然後看重复版本:同内容有几個 URL,系統選中的是哪一個,和你预期是否一致。
- 接着看頁面质量:正文是否完整、是否與站内其他頁大量雷同、有没有明确主题。
- 最後看入口:内鏈是否可達、站点地图是否包含、有没有其他頁面指向它。
- 改完不要立刻下结论,至少观察一到两個更新周期,再看同一批 URL 的狀態變化。
四、處理優先級:不是每個“已排除”都要動手
符合预期的排除項放着就好,逐條去“修”只會浪費時間,還可能把原本正常的頁面改成冲突狀態。真正需要處理的是三類:本该被收錄却長期停在“已抓取但未编入索引”、canonical 信号與系統選擇長期打架、以及返回碼或内容異常的软 404。
判断标准很简單:這個 URL 是否值得出現在搜尋结果里,且目前狀態與這個目标不一致。两者都成立,才叫問题。
五、看趋势,不看單日快照
索引报告本身有延迟,样本也在滚動。同一批 URL 今天在“已排除”,几天後可能自己變回“已编入索引”。更稳妥的做法是固定一批 URL 做長期跟踪,记錄狀態變化的時間点,再對照期間做過的改動。這样得到的结论,比盯着某一栏的數字波動可靠得多。
把“已排除”当成一個需要分類的問题,而不是一個统一的坏消息,能省下大量無效操作。分類清楚之後,绝大多數狀態其實不需要處理。