常见問题

入口頁设了 noindex,搜尋蜘蛛還會顺着連結發現目标 URL 吗?

入口頁不想被收錄就加 noindex,但這會不會连带切断連結、让目标 URL 無法被發現?本文区分 noindex 與 nofollow 的作用范围,說明連結發現和索引属于不同环节,並列出 robots.txt 誤用、整站响應头等常见坑,以及用請求头和服務器日誌自查的具体步骤。

常见問题

入口頁设了 noindex,搜尋蜘蛛還會顺着連結發現目标 URL 吗?

這是蜘蛛池和入口頁运营里很常见的疑問:入口頁自己不想被收錄,于是加了 noindex;同时又希望搜尋蜘蛛顺着上面的連結去發現目标 URL。那么 noindex 會不會连連結一起断掉?

先分清 noindex 和 nofollow 管的是什么

noindex 只针對頁面本身是否進入索引,它不负责切断頁面里的連結。nofollow 才作用于連結,表示這個連結不作為信任投票;但即便加了 nofollow,連結仍然可能被抓取、被用于發現新 URL,只是不再传递權重信号。

所以從机制上看:入口頁 noindex,頁面里的普通連結依然可能被搜尋蜘蛛解析和跟進。實际观察中,目标 URL 常常還是會被抓取,只是入口頁自己不出現在结果里。

為什么加了 noindex,連結仍然可能被發現

  • 搜尋蜘蛛抓取入口頁时會解析 HTML 拿到連結,連結發現這一步和是否收錄该頁是两個环节。
  • noindex 主要影响索引阶段,通常發生在抓取和解析之後。
  • 只要入口頁還能被外部連結、sitemap 或提交接口带進来,蜘蛛就仍可能来訪。
不過這不代表 noindex 對發現没有副作用。入口頁長期不被收錄,往往意味着它的抓取频次和重訪机會下降,連結被反复發現的概率也會變低。

容易踩坑的三種寫法

  • 把 noindex 寫進 robots.txt:robots.txt 不支持 noindex,只能寫 Disallow。用 Disallow 屏蔽入口頁,蜘蛛讀不到頁面内容,里面的連結自然也發現不了。
  • X-Robots-Tag: noindex 加在整站响應头:如果服務器统一给所有頁面加了這個头,目标 URL 自己也會被排除在索引之外,等于白做。
  • 多层跳轉後再 noindex:入口頁先 302 或 meta refresh 再落到带 noindex 的頁面,發現鏈路被拉長,中途容易被放弃。

怎么自查 noindex 有没有挡住發現

  1. 直接請求入口頁,看响應头和 HTML,確認 noindex 加在入口頁而不是目标頁。
  2. 查服務器日誌,確認搜尋蜘蛛是否真的抓過入口頁,返回的是 200 還是 3xx、4xx。
  3. 對比目标 URL 的抓取记錄。如果日誌里長期只有入口頁、没有目标頁,問题多半在連結形式或入口頁质量,而不是 noindex。
  4. 拿一批不加 noindex 的入口頁做對照,看目标 URL 的發現速度是否有明顯差异。

實践建议

如果入口頁只是不想被收錄、但要用它做連結中轉,把 noindex 放在该頁的 meta 标簽或该頁單獨設定的响應头即可,不要用 robots.txt 的 Disallow 去屏蔽。同时保證入口頁返回 200、正文可解析、連結是标准 a 标簽的绝對路径。

如果入口頁本身没什么價值、數量又很大,更合适的做法是收敛入口頁數量、按主题组织,而不是靠 noindex 堆量。noindex 只是索引层面的一個開關,它既不保證收錄,也不承诺提升發現效率。