什么是软 404:状态码正常,内容不成立
服务器返回 200,页面主体却只剩标题、导航和一句“暂无内容”——搜索引擎抓取后往往不会把它当成正常页面,而是标记为软 404,从索引中移除。它和硬 404 的区别在于:硬 404、410 是“这个地址不存在”,软 404 是“地址还在,但页面不成立”。两者在报告里出现的位置不同,处理方式也不一样。
容易被忽略的是,软 404 并不是错误配置导致的,多数时候是业务变化自然产生的。人工去逐个发现成本很高,所以需要用一套固定的核对顺序来筛。
哪些页面容易被判成软 404
- 商品下架、链接保留,但页面已无货也无替代信息
- 文章被删除,只留下模板框架和栏目导航
- 筛选、排序、翻页后没有结果的列表页,URL 参数仍然可访问
- 地区版或语言版没有对应内容,只剩空壳翻译模板
- 需要登录才能查看的页面,蜘蛛只看到登录提示
- 站内搜索结果页关键词无匹配
- 正文由前端渲染,但抓取时脚本未执行或加载失败,初始 HTML 里是空的
核对顺序:从“这页该不该存在”开始
第一步,判断页面是否仍有价值
有业务价值但当前没有内容(例如暂时缺货、季节下架),和彻底不再需要的页面,处理方式完全不同。前者要考虑怎么把内容补回来,后者要明确告知搜索引擎删除。先分类,再谈状态码。
第二步,看返回给蜘蛛的状态码和内容
用网址检查工具或抓取工具查看原始 HTML,重点确认三件事:返回码是多少、正文长度有多少、是否只剩导航和空容器。如果返回 200 但正文极短,被判定为软 404 的概率就比较高。
第三步,按类型决定处理方式
- 彻底删除:返回 410 或 404,不要 301 跳到首页或无关页面
- 暂时下架:保留 200,但补上明确说明和替代内容,例如“暂时缺货”加同类推荐
- 筛选空结果页:给参数页加 noindex,或让结果为空时返回 404
- 登录墙内容:要么开放部分预览,要么用 noindex 明确表示不参与索引
- 前端渲染型空壳:确保关键正文出现在初始 HTML 或能被正常抓取
第四步,处理之后怎么验证
用抓取测试确认状态码和内容是否符合预期,观察日志里该路径的抓取频率变化,再看索引报告里软 404 的数量是否下降。观察周期按周计算,不要只盯一两天就下结论。
软 404 报告里的数量变化,可能来自新抓取,也可能来自旧 URL 被重新分类。先确认变动的是一批什么 URL,再判断处理是否生效。
常见的几种误操作
- 把所有空页面统一改成 404,结果连原本还有价值的页面一起损失
- 明知没有内容仍返回 200,希望保留收录,实际结果通常是被判软 404 后移除
- 把删除页 301 到首页,容易被当作跳转异常或软 404 处理
- noindex 和软 404 混用,两个信号表达的意思不同,选一个说清楚即可
小结
软 404 的本质是“地址有效但内容不成立”。核对顺序是:先判断页面价值,再看状态码与内容完整度,然后按类型分别处理,最后用日志和索引报告做周期验证。状态码只是表达手段,真正决定能否留在索引里的,还是页面本身能不能提供内容。