打開索引覆盖率报告,很多人只盯着“有效”那一栏的數字,看到“已排除”下面一長串條目就紧張。其實“已排除”只是一個统称,里面混着三類性质完全不同的東西:你自己要求的排除、系統按規范做的归並、以及确實需要動手的技術問题。不先分類,就容易把正常狀態当成故障来修。
先看清狀態之間不是一回事
报告里常见的狀態大致可以分成几档:
- 已發現,尚未抓取:蜘蛛知道這個地址存在,還没排到队。
- 已抓取,尚未编入索引:蜘蛛来過了,也讀了内容,但系統暂时没把它放進索引。
- 已排除:明确不放進索引,後面會跟着一條原因。
前两種嚴格来说不算“排除”,只是還没走完流程。真正要看原因說明的,是第三類。而第三類下面的條目,又得再分一次。
第一類:主動屏蔽,改不改看你的意图
這一類是你自己下的指令,常见的有:
- robots.txt 里屏蔽了對應目錄
- 頁面带了 noindex 标簽或响應头
- 内容需要登入或被權限拦截
- 測試环境、内網地址被有意挡在外面
處理方式只有两種:如果這些頁面本来就不该出現在搜尋结果里,那它出現在“已排除”下是正确结果,不用管;如果現在需要被索引了,就把屏蔽撤掉,再让它重新被抓一次。這里的重点是先確認意图,再確認配置,不要看到排除字样就先把 robots 打開。
第二類:規范归並,通常不用處理
這一類是系統在多個地址之間做了選擇,常见原因包括:
- 备用網頁,有規范标簽指向別的地址
- 重复網頁,用戶未選定規范版本
- 重定向,或頁面已被新地址替換
這類排除往往是设計中的结果,同一份内容本来也不该有多個地址同时進索引。真正需要核對的是另一件事:被選中、被指向的那個規范地址,自己能不能被抓取、有没有進索引。如果規范地址本身也進不去,那問题不在“被排除”的這些頁面上,而在目标頁。
第三類:技術問题,需要排顺序修
這一類才是要動手的,典型的表現是:
- 404 與软 404:地址不存在,或者返回 200 但正文是空的
- 服務器错誤:5xx 導致的抓取失敗
- 抓取異常:连接超时、被防火墙拦截
- 内容為空或占位文本
處理顺序上,先解决可訪問性,再谈收錄。一個地址如果连稳定返回正常内容都做不到,讨论它有没有被索引意义不大。
只盯着條目數量會走偏
“已排除”條目多,不等于站点出了問题。一個结构正常的电商或内容站,光是分頁、篩選參數、标簽頁就能贡献大量正常的排除记錄。反過来,條目少也不代表没問题,真正要命的情况往往是被排除的頁面恰好是承载主要流量的那些。
比數量更有用的做法,是看排除原因的變化趋势:某一類原因突然增多,才值得去查最近改了什么。
一個可以照着走的核對顺序
- 把排除列表導出,按原因說明分组,而不是按頁面分组。
- 先标出属于主動屏蔽的條目,逐個確認是否仍然需要屏蔽。
- 再看規范归並類的條目,抽查它們指向的規范地址是否可正常訪問、是否在索引中。
- 剩下的按错誤類型排序:5xx 優先,其次是软 404 和内容為空的頁面,最後是普通 404。
- 修完之後留出一段時間再回看,不要一天改好几轮配置。
這一類問题的判断原則是:先判断這個地址该不该出現在索引里,再判断它為什么没進去。顺序颠倒,很容易白費力气。
索引覆盖率是一個观察工具,不是评分表。把“已排除”拆成上面這几類之後,你會發現大部分條目本来就不需要動作,真正要修的只有一小部分。