收录工作常被当成单向的加法:想办法让页面进索引。但真正做过一段时间运营就会发现,让页面干净地退出索引,难度往往更高。常见的问题不是选错了工具,而是把几个工具叠在一起用,结果谁都没生效,页面卡在一个尴尬的中间状态。
三种手段,各管一件事
先把机制分清楚,后面的顺序才有意义。
- robots.txt 的 Disallow:只阻止蜘蛛抓取这个 URL,并不等于让页面离开索引。如果站外有链接指向它,它仍可能以“无摘要”的形式出现在结果里。
- noindex:写在页面的 meta 标签里,或放在 HTTP 响应头的 X-Robots-Tag 中。它必须被蜘蛛抓到才能读到,所以页面不能被 robots.txt 挡住。
- 返回 404 或 410:页面本身消失。蜘蛛抓到后,索引里的条目会逐步清理,410 表达的信号比 404 更明确。代价是站内残留入口会让蜘蛛反复请求无效地址。
- 301 跳转:适合内容迁移或页面合并,把权重导向替代页,不是用于“单纯下架”的手段。
顺序错了会怎样
下面几种情况在实际站点里很常见:
- 先给目录加了 robots.txt 禁止,再给页面加 noindex。结果 noindex 永远读不到,索引里可能长期留着一条无摘要记录。
- 直接删掉页面,但站内链接、导航、站点地图都没清理。蜘蛛持续撞到 404,抓取预算被白白消耗。
- 页面已经 noindex,却还留在 sitemap 里,两个信号互相矛盾,处理时间被拉长。
- 只改了详情页模板,忘了分类页、标签页、作者页用的是同一套 meta。
noindex 需要被抓取才能被读到,robots.txt 恰恰阻止抓取。这两步顺序颠倒,页面就会停在最难看的状态:既没被移除,也没有有效内容可展示。
一个可执行的退出顺序
- 先定目标:是临时下架、永久移除,还是把内容合并到别的页面。目标不同,手段完全不同。
- 要合并就走 301:指向主题最接近的替代页,同时更新站内链接和站点地图。
- 要移除就先断入口:撤掉内链、导航和 sitemap 中的地址,避免蜘蛛反复发现它。
- 再上 noindex:用 meta 或 X-Robots-Tag 标记,并确认该 URL 没有被 robots.txt 挡住。
- 观察一段时间:等索引条目减少后,再决定是否需要返回 410,或保留一个简短的说明页。
- 大批量处理要分批:一次改几千个 URL,日志里的信号会变得难以解读,很难判断哪一步起了作用。
怎么确认它真的退出了
- 用站点查询和 URL 检查工具看该地址当前的状态,两边的口径未必一致,别只看一个。
- 看抓取日志:如果蜘蛛还在频繁请求,说明站内还有入口没断干净。
- 看站点地图文件:已经 noindex 的地址不应该继续出现在里面。
索引更新本身有延迟,通常是几周甚至更久。一两天没变化很正常,此时最忌讳的是叠加新手段——比如又加 robots 又加 404,把状态搅得更难判断。一次只改一个变量,观察清楚再动下一步,比一次性做全套更有效。