栏目改版、内容重写、临时下线,很多站点会给页面加一个 noindex 让它先退出索引;等事情做完,再把标签去掉,希望它重新回来。去掉标记只是第一步,页面能不能、多久能重新进入索引,还取决于另外几件事。
noindex 管的是索引,不是抓取
先把这个边界分清:noindex 的作用是告诉搜索引擎“抓到了也别放进索引”,它并不阻止蜘蛛来抓这个 URL。所以一个被 noindex 的页面,服务器日志里通常还是能看到抓取请求。这与 robots.txt 的 disallow 完全不同——后者是拒绝抓取,蜘蛛连页面内容都看不到。
这个区别在放行时很关键。如果你当初是“robots.txt 屏蔽 + noindex”双管齐下,那么蜘蛛近期根本没读过这个页面,也就无从得知 noindex 已经被移除。只删 HTML 里的标签而没有放开 robots.txt,页面会一直停在抓不到的状态。
先确认 noindex 写在哪一层
- HTML 的 meta 标签:最常见,放在 head 里,改模板或页面配置即可。
- HTTP 响应头的 X-Robots-Tag:整站、整目录或某类文件上批量设置时常用,改起来比页面标签隐蔽,容易漏。
- CMS 或 SEO 插件的全局开关:比如“整站暂不索引”,改某个栏目时可能连带影响其他页面。
放行之前,用抓取工具或在线查看工具确认一次:返回头里没有 X-Robots-Tag: noindex,HTML 里也没有残留的 meta noindex。两处都干净,才算真的放行。
放行前后要顺带处理的几件事
- 内容确实准备好了。蜘蛛回访时看到的如果是空列表、占位文案或“建设中”,很可能判为无价值,下一次回访周期会被拉长。
- canonical 指向自己。不少页面在 noindex 期间被顺手改过 canonical,指向了别的版本或旧地址。放行时把它改回自引用,否则等于自己声明“别收录我这一版”。
- 恢复内链入口。只把 URL 写进 sitemap,发现速度通常慢于从正文里有一条真实链接。栏目页、相关推荐、面包屑都可以作为入口。
- 返回码正常。200 直接可达,不要绕一条 301 链;也别停在 404 或软 404 状态。
- sitemap 里补上并更新 lastmod。这是给蜘蛛一个“这里变了”的提示,不保证立刻来,但比什么都不做要好。
放行不等于提交收录,也不等于会被收录。它只是把一扇原本关着的门打开。
时间上要有合理预期
重新收录的速度,取决于这个 URL 在站内的位置、站点整体抓取频率,以及内容本身是否值得留。首页和多入口的栏目页,往往比深藏在第三层的孤岛页快很多;老站内页的刷新节奏通常也比新站稳定。指望当天恢复并不现实,观察一到两个抓取周期更稳妥。
怎么验证放行生效
- 用 URL 检查工具看当前状态,确认可以抓取、可以索引。
- 在服务器日志里盯几天,看这个 URL 是否重新出现抓取记录,返回码是不是 200。
- 在索引覆盖报告里观察“已被 noindex 排除”的数量是否下降。
更稳的做法是分批放行:先放开几个样板页,观察抓取和索引状态正常,再逐步扩大到整批。一次性放开几百上千个页面,既不好排查问题,也容易在内容还没准备好时浪费抓取机会。