網站收錄

索引覆盖率报告怎么讀:已收錄、已排除與重复三類狀態的核對顺序

索引覆盖率报告的價值不在總數涨跌,而在于它把站内 URL 分成了几類狀態。本文說明已收錄、已排除、重复網頁等類別分別代表什么,以及核對时應按什么顺序看:先归類、再看共同特征、抽样確認原因,最後按特征批量處理,避免把待定狀態誤判成惩罚。

網站收錄

索引覆盖率报告怎么讀:已收錄、已排除與重复三類狀態的核對顺序

打開搜尋後台的索引覆盖率报告,第一反應往往是看總數涨了還是跌了。但這個报告真正的價值不在總數,而在于它把站内 URL 分成了几類狀態。同一批頁面被分到不同類別里,處理方式完全不同,混在一起看只會越看越乱。

先看清报告里的几類狀態

不同後台的叫法略有差异,但大体可以归成三组:

  • 已收錄:頁面被抓取且進入索引,至少具备被搜到的條件。
  • 已排除:系統知道這個 URL 存在,但有理由不把它放進索引。
  • 異常與错誤:抓取层面就出問题了,比如服務器错誤、重定向異常、被 robots.txt 拦下。

其中「已排除」里的原因最多,性质差別也最大,需要再往下拆一层。

已排除里最常见的几類及含义

已發現,尚未抓取

系統知道 URL,但還没排上抓取队列。這通常和抓取预算、站点响應速度、URL 總量有關,属于抓取环节的問题,不是质量判定。數量長期不降,才需要回头核對服務器响應和站内入口结构。

已抓取,尚未编入索引

頁面已经被抓到了,但系統暂时没有把它放進索引。這一類最容易被誤讀成「被惩罚」。實际上它更像一個待定狀態:内容是否足够獨立、是否和站内其他頁面高度相似、頁面主题是否清晰,都會影响後續判断。要做的是核對這批 URL 的頁面质量與重复情况,而不是反复提交。

重复網頁,系統選擇了其他規范頁

說明系統認為這個 URL 和另一個 URL 内容相近,並把另一個当成了主版本。此时要核對两件事:一是 canonical 是否指向了正确的版本;二是這两個頁面是不是真的應该同时存在。如果其中一個本来就该合並,要處理的是内容,不是标簽。

已被 noindex 或 robots.txt 屏蔽

這類是人為設定的排除,属于预期结果。核對时只需確認:被屏蔽的 URL 是不是你确實不想收錄的那批。如果誤伤,改回来即可。

核對顺序:從量大的類別開始

  1. 先看哪一類占比最大。占比最大的那類,决定了這一轮要解决的主要問题。
  2. 再看這些 URL 有没有共同特征:是否集中在某個栏目、某種參數、某個模板。
  3. 抽样几條,確認實际原因和類別描述是否一致。類別描述只是系統的判断,真實原因要回去看頁面。
  4. 按特征批量處理,處理完观察一到两周,再看比例變化。

逐條查單個 URL 效率很低,而且很容易把模板层面的問题当成偶發問题。

几個常见的誤判

  • 把「已抓取未编入索引」当成永久拒绝。它是動態狀態,會随内容和站内结构調整而變化。
  • 把「已排除」等同于「出問题了」。大量已排除是正常的,比如分頁、篩選參數、後台頁面。
  • 用提交量冲抵收錄量。提交只影响發現速度,不解决頁面本身的判断問题。
  • 只看總數不看分類。總數下跌有时只是把一批重复 URL 清理掉了,未必是坏事。
索引覆盖率是一張分類表,不是一張成绩單。先归類,再决定要不要動手。

什么时候该動,什么时候该等

如果某一類里绝大多數 URL 都是你本来就不想收錄的,那什么都不用做。如果某類里集中了核心内容頁,而且原因指向内容相近或入口不足,就按内容、内鏈、canonical 的顺序去查。改完之後给它一段時間重新评估,不要当天没變化就改第二遍。