什么是软 404:狀態碼正常,内容不成立
服務器返回 200,頁面主体却只剩标题、導航和一句“暂無内容”——搜尋引擎抓取後往往不會把它当成正常頁面,而是标记為软 404,從索引中移除。它和硬 404 的区別在于:硬 404、410 是“這個地址不存在”,软 404 是“地址還在,但頁面不成立”。两者在报告里出現的位置不同,處理方式也不一样。
容易被忽略的是,软 404 並不是错誤配置導致的,多數时候是业務變化自然产生的。人工去逐個發現成本很高,所以需要用一套固定的核對顺序来筛。
哪些頁面容易被判成软 404
- 商品下架、連結保留,但頁面已無货也無替代信息
- 文章被刪除,只留下模板框架和栏目導航
- 篩選、排序、翻頁後没有结果的列表頁,URL 參數仍然可訪問
- 地区版或語言版没有對應内容,只剩空壳翻译模板
- 需要登入才能查看的頁面,蜘蛛只看到登入提示
- 站内搜尋结果頁關鍵詞無匹配
- 正文由前端渲染,但抓取时脚本未执行或加载失敗,初始 HTML 里是空的
核對顺序:從“這頁该不该存在”開始
第一步,判断頁面是否仍有價值
有业務價值但目前没有内容(例如暂时缺货、季节下架),和彻底不再需要的頁面,處理方式完全不同。前者要考虑怎么把内容补回来,後者要明确告知搜尋引擎刪除。先分類,再谈狀態碼。
第二步,看返回给蜘蛛的狀態碼和内容
用網址检查工具或抓取工具查看原始 HTML,重点確認三件事:返回碼是多少、正文長度有多少、是否只剩導航和空容器。如果返回 200 但正文极短,被判定為软 404 的概率就比較高。
第三步,按類型决定處理方式
- 彻底刪除:返回 410 或 404,不要 301 跳到首頁或無關頁面
- 暂时下架:保留 200,但补上明确說明和替代内容,例如“暂时缺货”加同類推荐
- 篩選空结果頁:给參數頁加 noindex,或让结果為空时返回 404
- 登入墙内容:要么開放部分预览,要么用 noindex 明确表示不參與索引
- 前端渲染型空壳:确保關键正文出現在初始 HTML 或能被正常抓取
第四步,處理之後怎么驗證
用抓取測試確認狀態碼和内容是否符合预期,观察日誌里该路径的抓取频率變化,再看索引报告里软 404 的數量是否下降。观察周期按周計算,不要只盯一两天就下结论。
软 404 报告里的數量變化,可能来自新抓取,也可能来自舊 URL 被重新分類。先確認變動的是一批什么 URL,再判断處理是否生效。
常见的几種誤操作
- 把所有空頁面统一改成 404,结果连原本還有價值的頁面一起损失
- 明知没有内容仍返回 200,希望保留收錄,實际结果通常是被判软 404 後移除
- 把刪除頁 301 到首頁,容易被当作跳轉異常或软 404 處理
- noindex 和软 404 混用,两個信号表達的意思不同,選一個说清楚即可
小结
软 404 的本质是“地址有效但内容不成立”。核對顺序是:先判断頁面價值,再看狀態碼與内容完整度,然後按類型分別處理,最後用日誌和索引报告做周期驗證。狀態碼只是表達手段,真正决定能否留在索引里的,還是頁面本身能不能提供内容。