栏目改版、内容重寫、临时下线,很多站点會给頁面加一個 noindex 让它先登出索引;等事情做完,再把标簽去掉,希望它重新回来。去掉标记只是第一步,頁面能不能、多久能重新進入索引,還取决于另外几件事。
noindex 管的是索引,不是抓取
先把這個邊界分清:noindex 的作用是告诉搜尋引擎“抓到了也別放進索引”,它並不阻止蜘蛛来抓這個 URL。所以一個被 noindex 的頁面,服務器日誌里通常還是能看到抓取請求。這與 robots.txt 的 disallow 完全不同——後者是拒绝抓取,蜘蛛连頁面内容都看不到。
這個区別在放行时很關键。如果你当初是“robots.txt 屏蔽 + noindex”双管齐下,那么蜘蛛近期根本没讀過這個頁面,也就無從得知 noindex 已经被移除。只删 HTML 里的标簽而没有放開 robots.txt,頁面會一直停在抓不到的狀態。
先確認 noindex 寫在哪一层
- HTML 的 meta 标簽:最常见,放在 head 里,改模板或頁面配置即可。
- HTTP 响應头的 X-Robots-Tag:整站、整目錄或某類文件上批量設定时常用,改起来比頁面标簽隐蔽,容易漏。
- CMS 或 SEO 插件的全局開關:比如“整站暂不索引”,改某個栏目时可能连带影响其他頁面。
放行之前,用抓取工具或在线查看工具確認一次:返回头里没有 X-Robots-Tag: noindex,HTML 里也没有残留的 meta noindex。两處都干净,才算真的放行。
放行前後要顺带處理的几件事
- 内容确實准备好了。蜘蛛回訪时看到的如果是空列表、占位文案或“建设中”,很可能判為無價值,下一次回訪周期會被拉長。
- canonical 指向自己。不少頁面在 noindex 期間被顺手改過 canonical,指向了別的版本或舊地址。放行时把它改回自引用,否則等于自己声明“別收錄我這一版”。
- 恢复内鏈入口。只把 URL 寫進 sitemap,發現速度通常慢于從正文里有一條真實連結。栏目頁、相關推荐、面包屑都可以作為入口。
- 返回碼正常。200 直接可達,不要绕一條 301 鏈;也別停在 404 或软 404 狀態。
- sitemap 里补上並更新 lastmod。這是给蜘蛛一個“這里變了”的提示,不保證立刻来,但比什么都不做要好。
放行不等于提交收錄,也不等于會被收錄。它只是把一扇原本關着的门打開。
時間上要有合理预期
重新收錄的速度,取决于這個 URL 在站内的位置、站点整体抓取频率,以及内容本身是否值得留。首頁和多入口的栏目頁,往往比深藏在第三层的孤岛頁快很多;老站内頁的刷新节奏通常也比新站稳定。指望当天恢复並不現實,观察一到两個抓取周期更稳妥。
怎么驗證放行生效
- 用 URL 检查工具看目前狀態,確認可以抓取、可以索引。
- 在服務器日誌里盯几天,看這個 URL 是否重新出現抓取记錄,返回碼是不是 200。
- 在索引覆盖报告里观察“已被 noindex 排除”的數量是否下降。
更稳的做法是分批放行:先放開几個样板頁,观察抓取和索引狀態正常,再逐步扩大到整批。一次性放開几百上千個頁面,既不好排查問题,也容易在内容還没准备好时浪費抓取机會。