先分清三种“消失”
页面从站点上撤下来,到搜索结果里彻底消失,中间隔着好几步。动手之前先给页面对号入座,不同情况用不同的状态码,混着用只会拖慢清理节奏。
- 真删除:内容不再需要,也不打算迁移,对应 404 或 410。
- 已迁移:内容换了地址,或者并进了别的页面,对应 301。
- 临时下线:页面以后还要恢复,只是暂时不想被搜到,通常用 noindex 或权限控制,而不是直接删文件。
404 和 410 的差别没有想象中那么大
404 表示资源不存在,410 表示资源被永久移除。语义上 410 更明确,搜索引擎收到 410 后,理论上可以更快地把 URL 从索引里拿掉。但实际速度受抓取频率、站点整体质量、页面历史表现等影响,没有人能给出准确天数,也不必为了追求速度去硬造 410。
真正需要注意的是状态码要真实。有些站点把下架页面重定向到首页或栏目页,或者返回一个 200 的空白页,这在搜索引擎看来都不是“删除”,而是一个低质量页面,索引清理反而更慢。这种假删除,比老老实实返回 404 更麻烦。
什么时候该用 301
只要内容还有价值、只是换了位置,就应该用 301,把旧地址的信号传到新地址上。常见场景包括栏目改名、文章合并、路径调整。
- 只对内容确实相关的目标做 301,不要全站跳首页。
- 避免重定向链条,A 跳 B、B 再跳 C,最好直接 A 跳 C。
- 迁移完成后,站内旧链接要逐步换成新地址,不要长期依赖跳转。
跳转到无关页面,相当于告诉搜索引擎“这个地址还在,只是内容变了”,旧 URL 可能长期留在索引里。
批量下架页面的操作顺序
- 先切断站内入口:导航、列表、相关推荐、站内搜索结果里的旧链接。
- 从 sitemap 中移除这些 URL,不再继续提交。
- 让服务器返回正确状态码,404、410、301 各自归位。
- 确认没有被 robots.txt 屏蔽。屏蔽之后蜘蛛看不到状态码,反而无法判断页面已经删除。
- 需要 noindex 的页面,必须保持可抓取,否则规则读不到。
- 观察服务器日志里的状态码分布,确认蜘蛛重新抓取时拿到的是预期结果。
几个常见误区
- 用 robots.txt 屏蔽已删页面,以为消失得更快,结果索引长期不更新。
- noindex 和屏蔽同时使用,两条规则互相打架。
- 页面下架了,站内还有大量内链指向它,蜘蛛反复抓取却拿不到有效内容。
- 看到结果里还有旧链接就频繁改状态码,最后自己都说不清哪个地址返回什么。
怎么验收处理结果
不要每天搜一次就下结论。更稳妥的方式是看三处:服务器日志中这些 URL 最近一次被抓取时返回的状态码;站长工具里的索引状态与排除原因;站内是否还有指向旧地址的入口。三处对齐之后,剩下的就是等待,索引更新本身有周期,快慢不由单方面控制。
把 sitemap 和内链的维护流程一起理顺,页面上下线才不会留下太多尾巴。