noindex 是一個很不起眼的指令,寫法只有一行 meta 标簽,或者作為 X-Robots-Tag 挂在 HTTP 响應头上。它的作用很直接:告诉搜尋引擎這個地址不要出現在索引里。問题也正出在這里——它太好加了,加错时又几乎没有明顯症状,頁面照常打開、图片照常顯示、訪客毫無感觉,只有收錄情况在缓慢變化。
下面按誤加场景、抽查顺序、與 robots.txt 的配合三個部分梳理一遍。
一、noindex 通常是怎么被誤加的
- 開發或预發环境的配置被同步到线上,例如整站禁止索引的開關忘记關掉。
- CMS、主题或 SEO 插件自带禁止索引選項,預設勾選,或者被同事顺手点過一次。
- 頁面模板改版时,頁头被多個頁面共用,一處加错,整類頁面跟着受影响。
- 服務器或 CDN 层面添加了 X-Robots-Tag,前端代碼里完全看不到,只在响應头里出現。
- 批量編輯、導入導出时,某個字段被整列寫成了不索引。
二、自查的先後顺序
1. 先按頁面類型抽样
首頁、栏目頁、内容詳情頁、分頁第 2 頁、标簽聚合頁、站内搜尋结果頁、會員中心或後台頁面,各抽两三條。這几類頁面的處理策略本来就不同,混在一起看容易誤判。
2. 看頁面源碼,也看响應头
浏览器里查看網頁源代碼,能搜到 meta 标簽;但 X-Robots-Tag 只出現在 HTTP 响應头中,需要借助開發者工具的網絡面板,或者用命令行工具查看。两邊都別漏。
- 准备一份二十到五十條的代表性 URL 清單,覆盖上面提到的各類頁面。
- 查看响應头时,重点確認有没有 X-Robots-Tag 字段,以及它的取值。
- 再取頁面正文头部,確認 meta 标簽里的 robots 取值是 index 還是 noindex。
- 把结果整理成一張表,标出哪些頁面被禁止索引、哪些是预期之外的。
3. 對照 robots.txt
如果某個目錄既在 robots.txt 里被 Disallow,頁面里又寫着 noindex,這两條指令其實配合不上:蜘蛛根本抓不到頁面,也就讀不到那一行 noindex。结果是地址可能仍然留在索引里,只是没有摘要。想让它登出索引,更稳的顺序是放開抓取、保留 noindex,等索引中确實消失之後,再考虑是否屏蔽。
noindex 管的是要不要收錄,Disallow 管的是要不要来抓。把两者当成一回事,指令之間就會互相抵消。
三、哪些頁面适合加,哪些要谨慎
- 适合加:站内搜尋结果頁、排序與篩選组合頁、打印頁、彈窗落地頁、纯參數版本、临时測試頁和内部工具頁。
- 要谨慎:承担導航和内容聚合作用的栏目頁、标簽頁,一旦誤加,站内入口會明顯减少,属于重点排查對象。
- 可分情况:分頁列表的第 2、3 頁不必一律 noindex,用自指 canonical 處理也可以,具体看栏目本身的重要程度和内容量。
- 容易忘:临时活動頁在結束後要及时清理,既不该留在索引里,也不该繼續挂着 noindex 占位。
四、改完之後再做几件事
- 记錄改動時間和影响的 URL 范围,方便日後回溯。
- 挑几條重点頁面,观察後續抓取與展示是否恢复正常,不必急着下结论。
- 模板級別的改動要做全站复检,不要只看改過的那一個頁面。
- 把是否可索引列入上线检查項,和标题、描述、canonical 放在一起核對。
noindex 不是一次性配置。插件升級、模板替換、环境迁移,都可能把它悄悄改回来。每隔一段時間抽查一遍,比事後從收錄資料里倒推原因要省事得多。