做收錄排查时,很多人第一反應是怀疑内容质量或站点權重,但有一類原因更常见也更简單:頁面被站内配置主動挡住了。這類問题不用等,翻一遍配置就能確認。
三種屏蔽方式,作用的位置不一样
先把概念理清,後面的排查會快很多。
- robots.txt 的 Disallow:拦的是抓取。爬虫不會来取這個 URL,也就無從判断内容好坏。被 Disallow 的地址仍可能因為外部連結出現在搜尋结果里,只是没有摘要。
- meta robots 的 noindex:拦的是索引。爬虫正常抓取,讀完 HTML 後决定不把頁面放進索引。
- X-Robots-Tag 响應头:作用和 noindex 類似,但寫在 HTTP 头里,适合 PDF、图片、视频這類没有 head 标簽的文件。
三者经常被混用,最典型的一個错誤是:想让某個頁面從索引里消失,却先用 robots.txt 把它屏蔽了。结果是爬虫進不来,讀不到 noindex,頁面在索引里留很久。
排查时容易漏掉的几種情况
- 測試环境的 robots.txt 或 noindex 規則被一起發到了线上。
- 模板里统一加了 noindex,某個本该收錄的栏目没有單獨放開。
- 脚本在渲染後才插入 noindex 标簽,服務端返回的 HTML 里看不到。
- 頁面在登入、會員、地区或特定 UA 的拦截之後,爬虫訪問到的其實是登入頁或 403。
- CDN 或安全策略把搜尋爬虫当成異常流量拦下了,日誌里只留下拒绝记錄。
推荐的排查顺序
- 查看頁面源代碼里的 meta robots,確認有没有 noindex、nofollow。
- 用抓取測試工具查看 HTTP 响應头,看有没有 X-Robots-Tag。
- 打開 robots.txt,逐條核對目标目錄是否在 Disallow 里。
- 換不同 UA 訪問一次,確認没有登入墙、地区限制或拦截。
- 如果站点大量使用前端渲染,检查渲染後的 DOM 是否被注入 noindex。
- 以上都没問题,再去考虑内容质量和索引狀態本身。
想放開收錄,顺序也有讲究
如果確認是屏蔽導致的,調整时按依赖關系来:
- 先去掉 robots.txt 里的 Disallow,让爬虫能正常訪問。
- 再移除 meta robots 或 X-Robots-Tag 里的 noindex。
- 確認頁面返回 200,主要内容在服務端 HTML 里就能看到。
- 补上站内入口連結,必要时再提交 URL 或站点地图。
如果是反過来——頁面已被收錄、想让它登出索引,顺序就要颠倒:先保證可抓取,再加 noindex,等頁面從索引中消失後,才考虑用 robots.txt 屏蔽。
這類問题不需要什么技巧,但優先級很高:它决定後面所有優化是否還有意义。頁面连被抓取或索引的资格都没有,再去調标题、改内容都是空轉。花十几分钟把屏蔽层過一遍,通常比反复猜测有效得多。