搜索蜘蛛找到一条 URL,只是完成了“知道它存在”这一步。真正决定这条 URL 有没有价值的,是抓取之后拿到的内容。如果页面返回 200,却几乎没有实质内容,这类页面通常被称为软 404——它占着抓取机会,却交不出可用的结果。
软 404 的常见形态
软 404 不是技术错误,而是一种状态错位:HTTP 状态码说“正常”,页面内容却在说“这里没有东西”。常见形态包括:
- 筛选或排序后的空结果页,例如“颜色 + 尺码”组合下没有商品;
- 已下架、已删除的商品或文章详情页,模板还在,正文被清空;
- 空分类、空标签、空作者归档页;
- 需要登录或授权才能看到内容的页面,蜘蛛只拿到一句提示;
- 内容依赖前端脚本渲染,首屏 HTML 里只有骨架。
它对抓取与 URL 发现的实际影响
软 404 通常不会让 URL 消失,反而更容易被持续发现,因为它往往还挂在内链、Sitemap 或分页列表里。问题主要出在三个地方:
- 占用抓取机会。蜘蛛每次来访都花在空页面上,同样时间能覆盖的有效 URL 就变少。
- 干扰内容判断。大量“有 URL 没内容”的页面,会让站点整体显得单薄。
- 内链价值被稀释。指向空页面的链接,等于把权重送进一条没有终点的路径。
自查:先从真实日志和抽样开始
不要凭感觉判断。可以按下面的顺序核对:
- 从抓取日志里挑出返回 200、但响应体明显偏小的 URL;
- 按模板归类,例如详情模板、筛选模板、归档模板,看问题集中在哪一类;
- 抽样打开,确认是空内容、骨架屏,还是被登录墙挡住;
- 回到站内搜索与内链,看这些 URL 是否仍被大量链接指向。
怎么处理:保留、修复还是收敛
按页面是否还有未来价值分开处理:
- 确定不再有内容:下架商品、删除文章,返回 404 或 410,比返回 200 空页更清晰。
- 内容会回来:保留 URL,但补上说明与替代推荐,让页面有可用信息,而不是一片空白。
- 同类空页会大量再生:从入口层面收敛,减少可被发现的空组合 URL,例如限制筛选参数组合的链接输出。
- 已合并到新页面:用 301 指向替代 URL,并同步更新内链指向。
一个容易被忽略的细节
空结果页往往带有大量参数变体。处理时不要只改状态码,还要看这些变体是从哪条链接生成的。入口不收,空 URL 就会继续长出来。
URL 被发现是门票,内容才是入场的理由。软 404 不解决,抓取路径上就会一直挂着走不到尽头的分支。
和 URL 发现的关系
发现机制本身可能没有问题,Sitemap、内链、列表页都在正常工作。要调整的是发现之后的结果:让蜘蛛抓到的 URL,尽量落到一个内容明确的页面上。定期核对“被发现的 URL”和“有内容的 URL”之间的差额,是站点运营中相对省力的一种维护方式。