搜索抓取

软 404 与空壳页面:URL 能被发现,却拿不到有效内容的处理方式

搜索蜘蛛找到 URL 只是第一步,抓取后拿到什么内容才决定价值。本文说明软 404 的常见形态、它对抓取机会与内链价值的影响,并给出从日志抽样到处理决策的核对顺序,帮助减少“有 URL 没内容”的页面。

搜索抓取

软 404 与空壳页面:URL 能被发现,却拿不到有效内容的处理方式

搜索蜘蛛找到一条 URL,只是完成了“知道它存在”这一步。真正决定这条 URL 有没有价值的,是抓取之后拿到的内容。如果页面返回 200,却几乎没有实质内容,这类页面通常被称为软 404——它占着抓取机会,却交不出可用的结果。

软 404 的常见形态

软 404 不是技术错误,而是一种状态错位:HTTP 状态码说“正常”,页面内容却在说“这里没有东西”。常见形态包括:

  • 筛选或排序后的空结果页,例如“颜色 + 尺码”组合下没有商品;
  • 已下架、已删除的商品或文章详情页,模板还在,正文被清空;
  • 空分类、空标签、空作者归档页;
  • 需要登录或授权才能看到内容的页面,蜘蛛只拿到一句提示;
  • 内容依赖前端脚本渲染,首屏 HTML 里只有骨架。

它对抓取与 URL 发现的实际影响

软 404 通常不会让 URL 消失,反而更容易被持续发现,因为它往往还挂在内链、Sitemap 或分页列表里。问题主要出在三个地方:

  1. 占用抓取机会。蜘蛛每次来访都花在空页面上,同样时间能覆盖的有效 URL 就变少。
  2. 干扰内容判断。大量“有 URL 没内容”的页面,会让站点整体显得单薄。
  3. 内链价值被稀释。指向空页面的链接,等于把权重送进一条没有终点的路径。

自查:先从真实日志和抽样开始

不要凭感觉判断。可以按下面的顺序核对:

  1. 从抓取日志里挑出返回 200、但响应体明显偏小的 URL;
  2. 按模板归类,例如详情模板、筛选模板、归档模板,看问题集中在哪一类;
  3. 抽样打开,确认是空内容、骨架屏,还是被登录墙挡住;
  4. 回到站内搜索与内链,看这些 URL 是否仍被大量链接指向。

怎么处理:保留、修复还是收敛

按页面是否还有未来价值分开处理:

  • 确定不再有内容:下架商品、删除文章,返回 404 或 410,比返回 200 空页更清晰。
  • 内容会回来:保留 URL,但补上说明与替代推荐,让页面有可用信息,而不是一片空白。
  • 同类空页会大量再生:从入口层面收敛,减少可被发现的空组合 URL,例如限制筛选参数组合的链接输出。
  • 已合并到新页面:用 301 指向替代 URL,并同步更新内链指向。

一个容易被忽略的细节

空结果页往往带有大量参数变体。处理时不要只改状态码,还要看这些变体是从哪条链接生成的。入口不收,空 URL 就会继续长出来。

URL 被发现是门票,内容才是入场的理由。软 404 不解决,抓取路径上就会一直挂着走不到尽头的分支。

和 URL 发现的关系

发现机制本身可能没有问题,Sitemap、内链、列表页都在正常工作。要调整的是发现之后的结果:让蜘蛛抓到的 URL,尽量落到一个内容明确的页面上。定期核对“被发现的 URL”和“有内容的 URL”之间的差额,是站点运营中相对省力的一种维护方式。