打開搜尋後台的索引覆盖率报告,第一反應往往是看總數涨了還是跌了。但這個报告真正的價值不在總數,而在于它把站内 URL 分成了几類狀態。同一批頁面被分到不同類別里,處理方式完全不同,混在一起看只會越看越乱。
先看清报告里的几類狀態
不同後台的叫法略有差异,但大体可以归成三组:
- 已收錄:頁面被抓取且進入索引,至少具备被搜到的條件。
- 已排除:系統知道這個 URL 存在,但有理由不把它放進索引。
- 異常與错誤:抓取层面就出問题了,比如服務器错誤、重定向異常、被 robots.txt 拦下。
其中「已排除」里的原因最多,性质差別也最大,需要再往下拆一层。
已排除里最常见的几類及含义
已發現,尚未抓取
系統知道 URL,但還没排上抓取队列。這通常和抓取预算、站点响應速度、URL 總量有關,属于抓取环节的問题,不是质量判定。數量長期不降,才需要回头核對服務器响應和站内入口结构。
已抓取,尚未编入索引
頁面已经被抓到了,但系統暂时没有把它放進索引。這一類最容易被誤讀成「被惩罚」。實际上它更像一個待定狀態:内容是否足够獨立、是否和站内其他頁面高度相似、頁面主题是否清晰,都會影响後續判断。要做的是核對這批 URL 的頁面质量與重复情况,而不是反复提交。
重复網頁,系統選擇了其他規范頁
說明系統認為這個 URL 和另一個 URL 内容相近,並把另一個当成了主版本。此时要核對两件事:一是 canonical 是否指向了正确的版本;二是這两個頁面是不是真的應该同时存在。如果其中一個本来就该合並,要處理的是内容,不是标簽。
已被 noindex 或 robots.txt 屏蔽
這類是人為設定的排除,属于预期结果。核對时只需確認:被屏蔽的 URL 是不是你确實不想收錄的那批。如果誤伤,改回来即可。
核對顺序:從量大的類別開始
- 先看哪一類占比最大。占比最大的那類,决定了這一轮要解决的主要問题。
- 再看這些 URL 有没有共同特征:是否集中在某個栏目、某種參數、某個模板。
- 抽样几條,確認實际原因和類別描述是否一致。類別描述只是系統的判断,真實原因要回去看頁面。
- 按特征批量處理,處理完观察一到两周,再看比例變化。
逐條查單個 URL 效率很低,而且很容易把模板层面的問题当成偶發問题。
几個常见的誤判
- 把「已抓取未编入索引」当成永久拒绝。它是動態狀態,會随内容和站内结构調整而變化。
- 把「已排除」等同于「出問题了」。大量已排除是正常的,比如分頁、篩選參數、後台頁面。
- 用提交量冲抵收錄量。提交只影响發現速度,不解决頁面本身的判断問题。
- 只看總數不看分類。總數下跌有时只是把一批重复 URL 清理掉了,未必是坏事。
索引覆盖率是一張分類表,不是一張成绩單。先归類,再决定要不要動手。
什么时候该動,什么时候该等
如果某一類里绝大多數 URL 都是你本来就不想收錄的,那什么都不用做。如果某類里集中了核心内容頁,而且原因指向内容相近或入口不足,就按内容、内鏈、canonical 的顺序去查。改完之後给它一段時間重新评估,不要当天没變化就改第二遍。