網站收錄

頁面迟迟不收錄:先確認是不是被 noindex、robots 或登入墙挡住了

頁面不收錄时,先別急着改内容。meta robots 的 noindex、robots.txt 的 Disallow、X-Robots-Tag,以及登入墙和安全拦截,都會让頁面连被抓取或進入索引的机會都没有。本文梳理三者的作用差异、容易被忽略的屏蔽情况,以及放開收錄和登出索引时该遵循的操作顺序。

網站收錄

頁面迟迟不收錄:先確認是不是被 noindex、robots 或登入墙挡住了

做收錄排查时,很多人第一反應是怀疑内容质量或站点權重,但有一類原因更常见也更简單:頁面被站内配置主動挡住了。這類問题不用等,翻一遍配置就能確認。

三種屏蔽方式,作用的位置不一样

先把概念理清,後面的排查會快很多。

  • robots.txt 的 Disallow:拦的是抓取。爬虫不會来取這個 URL,也就無從判断内容好坏。被 Disallow 的地址仍可能因為外部連結出現在搜尋结果里,只是没有摘要。
  • meta robots 的 noindex:拦的是索引。爬虫正常抓取,讀完 HTML 後决定不把頁面放進索引。
  • X-Robots-Tag 响應头:作用和 noindex 類似,但寫在 HTTP 头里,适合 PDF、图片、视频這類没有 head 标簽的文件。

三者经常被混用,最典型的一個错誤是:想让某個頁面從索引里消失,却先用 robots.txt 把它屏蔽了。结果是爬虫進不来,讀不到 noindex,頁面在索引里留很久。

排查时容易漏掉的几種情况

  • 測試环境的 robots.txt 或 noindex 規則被一起發到了线上。
  • 模板里统一加了 noindex,某個本该收錄的栏目没有單獨放開。
  • 脚本在渲染後才插入 noindex 标簽,服務端返回的 HTML 里看不到。
  • 頁面在登入、會員、地区或特定 UA 的拦截之後,爬虫訪問到的其實是登入頁或 403。
  • CDN 或安全策略把搜尋爬虫当成異常流量拦下了,日誌里只留下拒绝记錄。

推荐的排查顺序

  1. 查看頁面源代碼里的 meta robots,確認有没有 noindex、nofollow。
  2. 用抓取測試工具查看 HTTP 响應头,看有没有 X-Robots-Tag。
  3. 打開 robots.txt,逐條核對目标目錄是否在 Disallow 里。
  4. 換不同 UA 訪問一次,確認没有登入墙、地区限制或拦截。
  5. 如果站点大量使用前端渲染,检查渲染後的 DOM 是否被注入 noindex。
  6. 以上都没問题,再去考虑内容质量和索引狀態本身。

想放開收錄,顺序也有讲究

如果確認是屏蔽導致的,調整时按依赖關系来:

  1. 先去掉 robots.txt 里的 Disallow,让爬虫能正常訪問。
  2. 再移除 meta robots 或 X-Robots-Tag 里的 noindex。
  3. 確認頁面返回 200,主要内容在服務端 HTML 里就能看到。
  4. 补上站内入口連結,必要时再提交 URL 或站点地图。
如果是反過来——頁面已被收錄、想让它登出索引,顺序就要颠倒:先保證可抓取,再加 noindex,等頁面從索引中消失後,才考虑用 robots.txt 屏蔽。

這類問题不需要什么技巧,但優先級很高:它决定後面所有優化是否還有意义。頁面连被抓取或索引的资格都没有,再去調标题、改内容都是空轉。花十几分钟把屏蔽层過一遍,通常比反复猜测有效得多。