删掉一个栏目、下架一批商品、合并两篇内容,这些操作在后台几秒钟就完成了。但过几天搜一下,旧链接还在结果里,点进去要么是 404,要么跳到一个新页面——于是很多人开始怀疑:是不是删除没生效?
其实从删除到索引里真正不再出现,中间隔着一次抓取、一次判断和一次更新。理解这个顺序,比反复刷新搜索结果有用得多。
先分清:你要的是“打不开”还是“别收录”
这两个目标对应的做法完全不同。
- 内容确实不再需要,希望用户和搜索引擎都别再访问——让 URL 返回 404 或 410。
- 内容换地方了,希望老链接把用户带过去——用 301 跳到最接近的新页面。
- 内容还在,只是暂时不公开——同样用 404 或 410,而不是 302 跳首页。
最容易出错的是第三种:临时下架就 302 跳首页,或者留一个空壳页面撑着。这类页面会被当成“内容空、还活着”,慢慢变成软 404,反而长期占着索引位置。
404 和 410:差在哪,怎么选
两者都表示这个地址没有内容了。区别在语义:404 是“找不到”,410 是“明确、永久地没有了”。
搜索引擎对 410 的处理往往更干脆,因为它不需要再反复确认这个 URL 会不会恢复。实践中:
- 内容永久删除、不会回来——优先 410。
- URL 拼错、文件从未存在——404 就够。
- 内容还在但换了地址——用 301,不要用 404 或 410。
需要提醒的是,410 不是“加速删除按钮”。搜索引擎仍然要重新抓一次这个 URL、确认返回码,才会更新索引。速度取决于它多快再来访问。
几个常见场景的处理思路
商品下架,未来可能重新上架
如果这个 SKU 还会回来,直接删页面代价不小。更稳的做法是保留原 URL,页面保留基础信息并说明当前状态,同时明确标注不可购买。这样老链接的用户体验和索引连续性都能保住。
内容合并,两篇变一篇
把被合并的 URL 301 到保留页,并确认保留页真的覆盖了原页面的核心信息。如果只是跳到首页或栏目页,等于告诉搜索引擎“这两篇没关系”,原来积累的链接价值基本就断了。
整个栏目或整站下线
整站要下线且不打算再上线,用 410 并保留一段时间是常见做法。但要注意:不要给整站加 noindex 之后立刻关站。爬虫抓不到页面,也就读不到 noindex,索引反而会停留更久。要么让服务器继续返回 404 / 410,要么在还能访问的阶段用 noindex 并等它生效。
只是不想让它出现在结果里
如果页面需要保留给用户访问,只是不希望被收录,用 noindex。robots.txt 的 disallow 会阻止抓取,爬虫读不到页面上的 noindex,结果常常是“没抓到但还在索引里”。
删除之后,还可以主动做几件事
- 确认服务器返回的是正确的状态码,而不是跳转,也不是 200 的空页面。
- 把新地址加进内链,让爬虫从站内就能走到,而不是只等着从外部发现。
- sitemap 里移除已删除的 URL,避免继续提交无效地址。
- 如果涉及敏感信息、需要紧急处理,可以用搜索平台的移除工具作为临时手段,它解决的是“先别显示”,不是长期状态。
- 检查旧链接的外链情况,能联系修改的尽量改到新 URL。
时间预期:别把过程当成故障
删除后的表现通常是这样:先是页面被抓取时返回 404 / 410,然后索引里这条记录逐渐淡化、减少出现,最后才完全不出现。这个过程从几天到几周都算常见,跟站点规模、链接数量、抓取频率都有关系。
判断删除是否成功,看的不是搜索结果,而是服务器返回码和索引状态的变化。前者你可以完全控制,后者需要时间。
与其每天搜一遍旧标题,不如把状态码、内链和 sitemap 这三件事确认好,剩下的交给抓取周期。真正出问题的,往往是状态码写错了,或者新旧 URL 之间没有建立任何关系。