不少人看收錄报告时,會把“已排除”的數字当成一個绩效指标:降了就放心,涨了就開始找原因。但這個數字本身說明不了太多問题,它是若干種原因的合計,里面既有你主動設定的正确排除,也有真正该動手處理的技術故障,還有一部分是平台基于自身判断做出的選擇。分不清這三類,就容易把時間花在根本不需要改的地方,真正影响抓取的頁面反而一直挂在那里。
一、“已排除”是一個集合,不是一種狀態
报告通常先给總量,展開之後才能看到具体原因。把這些原因归類,大致是三種:
- 你要求的排除:robots 屏蔽、頁面上的 noindex、需要登入才能訪問的頁面、後台和接口地址。
- 技術條件不满足:返回 4xx 或 5xx、跳轉鏈、重复 URL、抓取超时、渲染後仍為空壳。
- 内容层面的判断:内容過薄、與已有頁面高度相似、未被選為規范版本。
第一類說明設定生效了,第三類多數时候只能接受,只有第二類是明确要修的。混在一起看,就會誤判。
二、主動排除的頁面,別急着“恢复”
如果你用 robots.txt 或 noindex 屏蔽了站内搜尋结果頁、篩選參數頁、打印頁,這些頁面出現在排除列表里是正常结果。看到數量上涨就顺手放開,往往換来的是大量低质量 URL 被反复抓取,占用抓取配額,還可能稀释真正需要被索引的頁面。
要確認的不是“它為什么被排除”,而是“当初屏蔽它的理由還成立吗”。如果頁面已经改造成有獨立價值的栏目頁,再考虑放開;如果只是參數组合的排列,保持屏蔽更省事。
三、優先處理這几類技術性排除
- 非预期的 5xx。這是唯一會让你损失已有索引的错誤類型,應该最先看。它往往伴随服務器不稳定或某類模板报错,通常集中在同一個目錄下。
- 不该出現的 4xx。内鏈指向已刪除頁面、舊 URL 没有做跳轉,會让抓取预算消耗在死鏈上。
- 規范标记指向了無關頁面。canonical 寫错、模板批量輸出同一個地址、或分頁全部指向第一頁,都會让本可以獨立收錄的頁面被合並掉。
- 渲染後仍無内容。正文靠脚本加载、接口超时導致空白,抓取成功但拿到的是空壳,後續自然進不了索引。
- 软 404。查询無结果却返回 200 的空頁面,是典型的“抓得到但没價值”,容易長期停留在抓取队列里。
四、需要判断而不是一刀切的:重复與“已發現未收錄”
“已發現,尚未抓取”說明 URL 被识別了,但抓取還没轮到它。少量属于正常排队;如果長期大量堆积,通常是两類原因:一是站点里孤立 URL 太多,只能靠站点地图提示;二是頁面整体质量或權重不足以让抓取優先級提前。這时候可以先從内鏈入手,把重要頁面放進導航和正文連結里,比反复提交更有用。
内容重复的頁面則要問一句:两個版本對用戶是不是等價的?如果只是篩選參數不同、内容几乎一致,收敛成一份即可;如果是不同地区的服務頁,内容确實有差异,那就该给各自獨立的标题、描述和正文,而不是只換城市名。
五、一個可执行的检查顺序
- 先看 5xx,排除服務器和模板层面的故障。
- 再看非预期 4xx,补内鏈和跳轉。
- 核對 robots 與 noindex,確認屏蔽范围是否符合预期,有没有誤伤整站或整個目錄。
- 检查 canonical 輸出,尤其是列表頁、分頁和带參數的地址。
- 最後處理重复與内容過薄,這類改動周期長,放在後面做。
六、不用追的几個數字
排除總數的波動、單日抓取次數的起伏、某個目錄下頁面數量的增减,這些受平台調度影响很大,短期變化說明不了什么。真正值得盯的是趋势:重要目錄的收錄是否稳步增加,5xx 是否清零,抓取日誌里重要頁面的訪問频率有没有提升。
判断一個排除原因要不要處理,問三句话:這個頁面我們本来想不想让它出現在索引里?它現在對用戶有没有價值?修它會不會影响其他頁面的抓取?三個問题答完,優先級基本就出来了。
收錄是抓取、质量判断和平台調度共同作用的结果,没有人能保證某個頁面一定被索引。能做的是把技術障碍清掉,把该收敛的地址收敛掉,让抓取资源尽量落在真正重要的頁面上。剩下的,交给時間和持續的更新节奏。