网站收录

页面已删除,索引里还留着旧地址:状态码、内链与移除请求的核对顺序

页面删除或下线之后,搜索里仍能搜到旧地址,点进去显示 404。这通常不是收录异常,而是删除时没有给出明确信号。本文按迁移与删除的区分、状态码确认、robots 放行、站内链接与 sitemap 清理、移除工具的使用顺序,梳理一套可执行的核对流程。

网站收录

页面已删除,索引里还留着旧地址:状态码、内链与移除请求的核对顺序

把一批页面下线或删除之后,过一段时间再搜站点,仍然能看到那些旧地址,点进去显示 404。这个现象很常见,但先别急着把它当成收录异常——问题往往不在“为什么还收录”,而在“删除的方式有没有给蜘蛛一个明确信号”。

先分清:这是删除,还是迁移

很多“删了还在”的情况,其实是页面被搬到了新地址,只是旧地址没有做 301。蜘蛛手里还留着旧记录,用户点进去却是 404,这就属于迁移没做完。判断方式很简单:这段内容站里还有没有?如果还有,就找新地址补一条 301;如果确实不要了,再往下看。

第一步:确认旧地址返回的状态码

  • 200:页面还在,或者落到了软 404 页面,返回正常但内容不存在,蜘蛛会当作有效页继续保留。
  • 301:指向新地址,属于正常迁移,索引会随抓取逐步更新。
  • 302 / 307:临时跳转,蜘蛛可能长期保留旧地址,如果是永久变更建议换成 301。
  • 404:内容不存在,会被逐步移除,速度取决于该路径的抓取频率。
  • 410:明确告知已永久删除,通常比 404 处理得干净一些。
  • 403 / 500:拒绝访问或服务器出错,蜘蛛无法确认页面状态,旧记录反而容易停住不动。

要注意的是,大量页面同时变成 404 和单页删除并不一样。前者更像整站调整,蜘蛛的处理节奏也会不同。

第二步:确认蜘蛛能不能拿到这个状态码

一个容易被忽略的点:如果这个路径在 robots.txt 里被屏蔽了,蜘蛛拿不到状态码,就无法确认页面已经删除,索引里的旧地址会长期不动。所以删除页面时,先确保对应路径是放行的,等收录移除之后,再考虑是否屏蔽。

同理,登录墙、地区限制、CDN 规则拦截,也会造成“蜘蛛看不到真实状态”的情况。排查时不妨用抓取工具的模拟访问,看看返回的是不是和用户看到的一致。

第三步:核对站内还有谁指向旧地址

  1. 站内链接:导航、面包屑、相关推荐、正文里如果仍指向旧地址,蜘蛛会持续发现它。
  2. sitemap:文件里如果还列着已删除的地址,等于主动把失效 URL 再交一遍。
  3. 跳转链:A 指向旧地址、旧地址再指向新地址,链条越长越难被处理,能直连就直连。
  4. 外链:这部分不好控制,可以作为“移除慢”的合理解释,不必为此反复提交。

第四步:索引本身要不要主动处理

如果受影响页面数量多,可以用搜索平台的移除工具做临时隐藏。但要清楚它的性质:它是短期措施,不是永久删除。真正的移除仍然取决于蜘蛛重新抓取时拿到的状态码。

常见的错误做法包括:把所有失效页 301 到首页、在 404 页上加 noindex、反复提交同一条移除请求。前两种会让蜘蛛拿到自相矛盾的信号,第三种基本没有额外收益。

移除请求解决的是“暂时别显示”,状态码解决的是“这个地址已经不存在”。两件事要分开做。

什么时候可以不用管

如果只是十几个老页面慢慢消失,站点整体收录和流量也没受影响,通常不值得投入太多精力,把时间放在仍有价值的页面和站内结构上更划算。真正需要认真处理的,是批量删除、整站改版、URL 结构大改这几类情况,因为分散的旧地址会形成持续的噪音。

一个简单的核对顺序

  1. 内容还在吗?在的话,做 301 指向新地址。
  2. 确实删除,确认返回 404 或 410,而不是 200 软 404。
  3. 路径是否被 robots 屏蔽?屏蔽了就先放行。
  4. 站内链接与 sitemap 是否仍指向旧地址?清理掉。
  5. 数量多、影响大,用移除工具做临时处理,然后等待重新抓取。
  6. 过一段时间复查:旧地址是否仍在索引里,状态码是否稳定。

收录的移除和收录的建立一样,都要经过发现、抓取、判断三个阶段。删除页面时给出的信号越明确,收敛越快;信号模糊或者自相矛盾,旧记录就会在原地停很久。