搜尋抓取

软 404 與空壳頁消耗抓取预算:狀態碼正常但内容為空的核對清單

返回 200 但内容為空的软 404 頁面會持續占用抓取配額,让真正需要被發現的新入口排到後面。本文梳理软 404 的常见形態、日誌核對清單與收敛方式,帮助站点区分真假空壳頁,减少無效抓取。

搜尋抓取

软 404 與空壳頁消耗抓取预算:狀態碼正常但内容為空的核對清單

很多站点在抓取日誌里看起来狀態碼很干净,200 占绝大多數,但真正有内容、有價值的 URL 却不多。問题往往不在服務器,而在那些返回 200 却没有實质内容的頁面,也就是常说的软 404。它們和真正的 404 一样占用抓取配額,却不像 404 那样容易被识別和收敛。

软 404 的常见形態

  • 篩選或排序後無结果的列表頁,返回 200,正文只有一句暂無資料
  • 已下架商品或已過期活動的詳情頁,模板還在,正文為空
  • 由參數拼出来的归档、日歷類頁面,只有連結没有内容
  • 内容合並後留下的舊 URL,頁面只剩導航和頁脚
  • 需要登入或權限才能看到正文的頁面,匿名抓取只能拿到空壳

它為什么比真 404 更麻烦

真 404 在日誌里一目了然,抓取工具通常較快降低回訪频率;软 404 表面完全正常,只能靠正文長度、模板重复比例等信号来判断,判断成本高,回訪的衰减也更慢。结果就是一批低價值 URL 持續拿走抓取次數,需要被發現的新入口反而排到後面。

核對清單

  1. 統計近 30 天返回 200 的 URL 中,正文長度低于阈值(例如可见字符少于 200)的占比。
  2. 按目錄分组,看空壳頁是否集中在某几個目錄,判断是模板問题還是内容問题。
  3. 检查這些頁面是否出現在 sitemap 或站内連結里,是否存在主動提交空頁的情况。
  4. 查看回訪次數:同一批空壳 URL 在過去两周被反复抓取了多少次。
  5. 寻找可批量识別的路径或參數模式,例如篩選參數、标簽頁、归档頁的固定前缀。
  6. 對比空壳頁與正常内容頁的抓取時間戳分布,看是否挤占了抓取相對集中的时段。
  7. 检查 404 頁面本身是否返回 200 且带完整導航,避免真假错誤頁混在一起。

收敛方式

處理方向大致三類:让它變成明确的错誤狀態,让它不再被指向,或者让它重新具备内容價值。

  • 無结果頁:返回 404 或 410,或改造成有聚合價值的落地頁,比如推荐分類、热门内容入口。
  • 下架内容:返回 410,同时從 sitemap 和站内連結中移除,避免繼續被指向。
  • 權限頁:匿名訪問返回 401 或 403,不要返回 200 的空壳。
  • 模板性空頁:加 noindex,並從内鏈结构中摘掉入口。
  • 批量參數頁:用 robots 規則或參數收口方式限制扩散,避免繼續生成新的组合。

日誌與指标怎么讀

重点看三個數字:200 狀態中短正文頁面的比例、空壳 URL 的平均回訪間隔、以及這些頁面占全天抓取量的比重。如果短正文頁拿走三成以上抓取量,而新内容從發布到被發現的時間還在拉長,基本可以判断抓取预算被消耗在了無效入口上。

注意:收紧狀態碼之前,先確認頁面确實對用戶没有價值。不要因為正文短就一刀切地把正常短頁面改成 410,誤伤會造成真實入口消失,恢复周期往往比预期更長。

软 404 不會立刻带来可见的损失,它更像一種持續的小額支出。定期抽样、按目錄核對、按路径模式收敛,通常比一次性大改更稳妥,也更容易在日誌里驗證效果。