網站收錄

曾经被 noindex 的頁面想重新收錄:放行前後要確認的几件事

頁面加過 noindex 之後想重新回到索引,光删掉标簽往往不够。需要先分清 noindex 與 robots.txt 的区別,检查 HTML 标簽和响應头两處設定,並把 canonical、内鏈入口、sitemap 和返回碼一並理顺,再分批放行观察。

網站收錄

曾经被 noindex 的頁面想重新收錄:放行前後要確認的几件事

栏目改版、内容重寫、临时下线,很多站点會给頁面加一個 noindex 让它先登出索引;等事情做完,再把标簽去掉,希望它重新回来。去掉标记只是第一步,頁面能不能、多久能重新進入索引,還取决于另外几件事。

noindex 管的是索引,不是抓取

先把這個邊界分清:noindex 的作用是告诉搜尋引擎“抓到了也別放進索引”,它並不阻止蜘蛛来抓這個 URL。所以一個被 noindex 的頁面,服務器日誌里通常還是能看到抓取請求。這與 robots.txt 的 disallow 完全不同——後者是拒绝抓取,蜘蛛连頁面内容都看不到。

這個区別在放行时很關键。如果你当初是“robots.txt 屏蔽 + noindex”双管齐下,那么蜘蛛近期根本没讀過這個頁面,也就無從得知 noindex 已经被移除。只删 HTML 里的标簽而没有放開 robots.txt,頁面會一直停在抓不到的狀態。

先確認 noindex 寫在哪一层

  • HTML 的 meta 标簽:最常见,放在 head 里,改模板或頁面配置即可。
  • HTTP 响應头的 X-Robots-Tag:整站、整目錄或某類文件上批量設定时常用,改起来比頁面标簽隐蔽,容易漏。
  • CMS 或 SEO 插件的全局開關:比如“整站暂不索引”,改某個栏目时可能连带影响其他頁面。

放行之前,用抓取工具或在线查看工具確認一次:返回头里没有 X-Robots-Tag: noindex,HTML 里也没有残留的 meta noindex。两處都干净,才算真的放行。

放行前後要顺带處理的几件事

  1. 内容确實准备好了。蜘蛛回訪时看到的如果是空列表、占位文案或“建设中”,很可能判為無價值,下一次回訪周期會被拉長。
  2. canonical 指向自己。不少頁面在 noindex 期間被顺手改過 canonical,指向了別的版本或舊地址。放行时把它改回自引用,否則等于自己声明“別收錄我這一版”。
  3. 恢复内鏈入口。只把 URL 寫進 sitemap,發現速度通常慢于從正文里有一條真實連結。栏目頁、相關推荐、面包屑都可以作為入口。
  4. 返回碼正常。200 直接可達,不要绕一條 301 鏈;也別停在 404 或软 404 狀態。
  5. sitemap 里补上並更新 lastmod。這是给蜘蛛一個“這里變了”的提示,不保證立刻来,但比什么都不做要好。
放行不等于提交收錄,也不等于會被收錄。它只是把一扇原本關着的门打開。

時間上要有合理预期

重新收錄的速度,取决于這個 URL 在站内的位置、站点整体抓取频率,以及内容本身是否值得留。首頁和多入口的栏目頁,往往比深藏在第三层的孤岛頁快很多;老站内頁的刷新节奏通常也比新站稳定。指望当天恢复並不現實,观察一到两個抓取周期更稳妥。

怎么驗證放行生效

  • 用 URL 检查工具看目前狀態,確認可以抓取、可以索引。
  • 在服務器日誌里盯几天,看這個 URL 是否重新出現抓取记錄,返回碼是不是 200。
  • 在索引覆盖报告里观察“已被 noindex 排除”的數量是否下降。

更稳的做法是分批放行:先放開几個样板頁,观察抓取和索引狀態正常,再逐步扩大到整批。一次性放開几百上千個頁面,既不好排查問题,也容易在内容還没准备好时浪費抓取机會。