做站点运营的人常会盯着“有多少 URL 进了索引”,但很少回头看这些 URL 指向的页面到底有没有实质内容。状态码是 200、能被抓取、有入口链接,搜索引擎就可能把它当作有效页面处理——哪怕用户打开后只看到一句“暂无结果”。这类页面通常被称为软404。
软404是什么:状态码正常,内容不正常
软404指的是 URL 可以正常访问、服务器返回 200,但页面内容为空、只剩下重复模板,或者干脆是错误提示。常见的几种形态:
- 站内搜索没有匹配结果,却仍返回 200 的无结果页
- 分类、标签、筛选项下没有任何条目的空列表页
- 商品或文章下架后,模板保留、正文被清空
- 参数拼接出来的页面,只有页头页脚和一组筛选条件
对用户来说这些页面没有价值,对搜索引擎也一样。区别在于,用户关掉就走,而蜘蛛会把 URL 记下来。
为什么它们容易被收录
索引判断依赖的是信号,而不是“好不好看”。一个软404页面往往同时具备几个容易被收录的条件:
- 返回 200,等于没有告诉蜘蛛“这里没东西”
- 页面上存在内链入口,甚至由导航或列表页批量输出
- 模板结构完整,标题、正文、面包屑一应俱全
- 生成成本低、数量大,一次筛选就能造出成百上千条
于是索引里就多了一批“看起来像页面、点开没内容”的 URL。
危害不只是占个位置
第一是抓取预算。蜘蛛的时间有限,反复抓取无内容页面,真正需要更新的页面就分得少。第二是质量评估,大量空页面会让站点整体内容质量被拉低。第三是用户体验,从搜索结果点进来发现没有内容,跳出和返回搜索都会发生。
怎么自查
- 在站内搜索里输入随机字符串,看无结果页返回什么状态码
- 翻日志或索引数据,筛出内容字数极少、模板高度雷同的 URL
- 检查分类和标签页,是否存在只有标题、没有条目的情况
- 核对下架流程,确认内容下架后页面是被保留还是被收口
处理方式:按页面类型分开做
- 搜索无结果页:返回 404,或加 noindex,避免被当成独立页面处理
- 长期为空的分类、标签页:合并到上级栏目,或补入推荐内容,不要让它空着还持续输出内链
- 已下架且不会恢复的内容:用 410 表达更明确;有替代页面时用 301 指向替代页
- 筛选参数生成的空结果:限制可被抓取的参数组合,或对无结果状态统一收口
注意:不是所有空态都要返回 404。筛选条件本身是用户操作的一部分,无结果时页面仍应正常展示,关键是不让它成为可以被独立索引的 URL。
收口之后别急着看结果
索引更新需要时间。处理完之后,先观察日志里这些 URL 的抓取频率是否下降,再看索引中是否逐步减少。期间不要反复切换状态码,也不要来回加删 noindex,那会让蜘蛛难以判断页面的稳定状态。
收录数量本身不是目标。把没有内容的 URL 收干净,留下的通道才更顺畅。