网站收录

软 404 和空壳页面:没内容的 URL 被收录了怎么办

页面能打开、状态码 200,但主体没有实质内容,这类软 404 和空壳页面容易被抓取并进入索引。本文说明它和真正 404 的区别、常见来源、判断方法,以及指向替代页面、返回 410、加 noindex 的取舍顺序。

网站收录

软 404 和空壳页面:没内容的 URL 被收录了怎么办

有些 URL 打开是正常的:状态码 200,有页头页脚,有标题,但页面主体没有真正的内容。下架的商品、搜索无结果的页面、筛选条件拼不出结果的列表、暂时没有文章的栏目,都会长成这样。它们常被叫做软 404 或空壳页面,因为对用户和蜘蛛来说,这条地址等于什么也没提供。

它和真正的 404、410 差在哪

真正的 404 是明确的信号:这个地址没有内容,蜘蛛会逐步把它清出索引。软 404 返回的是 200,等于告诉蜘蛛「这里有一页正常内容」,只是内容恰好是空的。蜘蛛不会因此报错,反而可能把它当普通页面处理,抓取、渲染、甚至收录。差别不在内容多少,而在状态码给出的信号是否一致。

这类页面通常从哪冒出来

  • 站内搜索的无结果页,参数不同就生成一条新地址。
  • 已下架或已删除的内容,页面还在,只是换成了一句提示。
  • 筛选、排序、分页越界后返回的空列表。
  • 会员中心、订单详情等需要登录才能看到内容的页面,未登录时只剩框架。
  • 栏目建立后长期没有更新内容,模板照常输出。

为什么值得花时间清理

一是消耗抓取资源。蜘蛛在空页面上花的时间,本来可以拿去抓有内容的页面。二是影响质量判断。站点里长期存在大量只有模板的页面,会让搜索引擎对整站的内容密度打折扣。三是用户在搜索结果里点到这种页面会直接退回,这种反馈最终也会体现到页面的表现上。

怎么判断一个页面是不是软 404

  1. 用不带登录态的请求抓一次页面,看返回的状态码和正文长度。
  2. 把模板文字去掉,看剩下的内容是不是只有「暂无内容」「没有找到」这类提示。
  3. 在服务器日志里看这类地址被访问的频率,以及蜘蛛是否反复来访。
  4. 抽样搜索几条这种地址,确认是否已经进了索引。

处理顺序建议

先分类,再决定动作,不要一刀切全部删掉。

  • 有替代内容:比如下架商品还有同类目页面,做 301 指向最近的可用页面。
  • 彻底没有价值:返回 404 或 410,让信号明确。已经无人引用的页面用 410 表达更干脆。
  • 页面本身要保留,只是不该被索引:加 noindex,并且确保它没有被 robots.txt 屏蔽——被屏蔽的页面蜘蛛读不到 noindex,反而可能长期留在索引里。
  • 清理内链:把指向这些地址的站内链接换成有效入口,否则蜘蛛还会顺着老链接反复来访。
判断标准很简单:这条地址如果被用户直接搜到,他会不会觉得自己被骗了。会,就不要让它以 200 的状态留在索引里。

几个容易踩的坑

一是用 robots.txt 屏蔽代替处理,结果页面既不能被读取也不能被移除。二是只改了页面内容却不改状态码,空壳依旧是 200。三是把正常但内容较少的页面也当成软 404 删掉,比如联系方式页、说明页,这类页面有明确用途,不属于空壳。四是一次性批量删除却不做跳转,用户从外部链接进来只看到错误页。

软 404 不会有报错提醒,只能靠定期巡检发现。把状态码、正文长度和站内链接一起看,比单看收录数量更能说明问题。