網站收錄

索引覆盖率里的“已排除”:先分清主動屏蔽、規范归並和技術問题

索引覆盖率报告里的“已排除”是一堆原因混在一起的统称。里面既有你自己設定的屏蔽,也有系統按規范做的归並,還有确實要修的错誤。不先分類就動手,容易把正常狀態当故障處理。

網站收錄

索引覆盖率里的“已排除”:先分清主動屏蔽、規范归並和技術問题

打開索引覆盖率报告,很多人只盯着“有效”那一栏的數字,看到“已排除”下面一長串條目就紧張。其實“已排除”只是一個统称,里面混着三類性质完全不同的東西:你自己要求的排除、系統按規范做的归並、以及确實需要動手的技術問题。不先分類,就容易把正常狀態当成故障来修。

先看清狀態之間不是一回事

报告里常见的狀態大致可以分成几档:

  • 已發現,尚未抓取:蜘蛛知道這個地址存在,還没排到队。
  • 已抓取,尚未编入索引:蜘蛛来過了,也讀了内容,但系統暂时没把它放進索引。
  • 已排除:明确不放進索引,後面會跟着一條原因。

前两種嚴格来说不算“排除”,只是還没走完流程。真正要看原因說明的,是第三類。而第三類下面的條目,又得再分一次。

第一類:主動屏蔽,改不改看你的意图

這一類是你自己下的指令,常见的有:

  • robots.txt 里屏蔽了對應目錄
  • 頁面带了 noindex 标簽或响應头
  • 内容需要登入或被權限拦截
  • 測試环境、内網地址被有意挡在外面

處理方式只有两種:如果這些頁面本来就不该出現在搜尋结果里,那它出現在“已排除”下是正确结果,不用管;如果現在需要被索引了,就把屏蔽撤掉,再让它重新被抓一次。這里的重点是先確認意图,再確認配置,不要看到排除字样就先把 robots 打開。

第二類:規范归並,通常不用處理

這一類是系統在多個地址之間做了選擇,常见原因包括:

  • 备用網頁,有規范标簽指向別的地址
  • 重复網頁,用戶未選定規范版本
  • 重定向,或頁面已被新地址替換

這類排除往往是设計中的结果,同一份内容本来也不该有多個地址同时進索引。真正需要核對的是另一件事:被選中、被指向的那個規范地址,自己能不能被抓取、有没有進索引。如果規范地址本身也進不去,那問题不在“被排除”的這些頁面上,而在目标頁。

第三類:技術問题,需要排顺序修

這一類才是要動手的,典型的表現是:

  • 404 與软 404:地址不存在,或者返回 200 但正文是空的
  • 服務器错誤:5xx 導致的抓取失敗
  • 抓取異常:连接超时、被防火墙拦截
  • 内容為空或占位文本

處理顺序上,先解决可訪問性,再谈收錄。一個地址如果连稳定返回正常内容都做不到,讨论它有没有被索引意义不大。

只盯着條目數量會走偏

“已排除”條目多,不等于站点出了問题。一個结构正常的电商或内容站,光是分頁、篩選參數、标簽頁就能贡献大量正常的排除记錄。反過来,條目少也不代表没問题,真正要命的情况往往是被排除的頁面恰好是承载主要流量的那些。

比數量更有用的做法,是看排除原因的變化趋势:某一類原因突然增多,才值得去查最近改了什么。

一個可以照着走的核對顺序

  1. 把排除列表導出,按原因說明分组,而不是按頁面分组。
  2. 先标出属于主動屏蔽的條目,逐個確認是否仍然需要屏蔽。
  3. 再看規范归並類的條目,抽查它們指向的規范地址是否可正常訪問、是否在索引中。
  4. 剩下的按错誤類型排序:5xx 優先,其次是软 404 和内容為空的頁面,最後是普通 404。
  5. 修完之後留出一段時間再回看,不要一天改好几轮配置。
這一類問题的判断原則是:先判断這個地址该不该出現在索引里,再判断它為什么没進去。顺序颠倒,很容易白費力气。

索引覆盖率是一個观察工具,不是评分表。把“已排除”拆成上面這几類之後,你會發現大部分條目本来就不需要動作,真正要修的只有一小部分。