這是蜘蛛池和入口頁运营里很常见的疑問:入口頁自己不想被收錄,于是加了 noindex;同时又希望搜尋蜘蛛顺着上面的連結去發現目标 URL。那么 noindex 會不會连連結一起断掉?
先分清 noindex 和 nofollow 管的是什么
noindex 只针對頁面本身是否進入索引,它不负责切断頁面里的連結。nofollow 才作用于連結,表示這個連結不作為信任投票;但即便加了 nofollow,連結仍然可能被抓取、被用于發現新 URL,只是不再传递權重信号。
所以從机制上看:入口頁 noindex,頁面里的普通連結依然可能被搜尋蜘蛛解析和跟進。實际观察中,目标 URL 常常還是會被抓取,只是入口頁自己不出現在结果里。
為什么加了 noindex,連結仍然可能被發現
- 搜尋蜘蛛抓取入口頁时會解析 HTML 拿到連結,連結發現這一步和是否收錄该頁是两個环节。
- noindex 主要影响索引阶段,通常發生在抓取和解析之後。
- 只要入口頁還能被外部連結、sitemap 或提交接口带進来,蜘蛛就仍可能来訪。
不過這不代表 noindex 對發現没有副作用。入口頁長期不被收錄,往往意味着它的抓取频次和重訪机會下降,連結被反复發現的概率也會變低。
容易踩坑的三種寫法
- 把 noindex 寫進 robots.txt:robots.txt 不支持 noindex,只能寫 Disallow。用 Disallow 屏蔽入口頁,蜘蛛讀不到頁面内容,里面的連結自然也發現不了。
- X-Robots-Tag: noindex 加在整站响應头:如果服務器统一给所有頁面加了這個头,目标 URL 自己也會被排除在索引之外,等于白做。
- 多层跳轉後再 noindex:入口頁先 302 或 meta refresh 再落到带 noindex 的頁面,發現鏈路被拉長,中途容易被放弃。
怎么自查 noindex 有没有挡住發現
- 直接請求入口頁,看响應头和 HTML,確認 noindex 加在入口頁而不是目标頁。
- 查服務器日誌,確認搜尋蜘蛛是否真的抓過入口頁,返回的是 200 還是 3xx、4xx。
- 對比目标 URL 的抓取记錄。如果日誌里長期只有入口頁、没有目标頁,問题多半在連結形式或入口頁质量,而不是 noindex。
- 拿一批不加 noindex 的入口頁做對照,看目标 URL 的發現速度是否有明顯差异。
實践建议
如果入口頁只是不想被收錄、但要用它做連結中轉,把 noindex 放在该頁的 meta 标簽或该頁單獨設定的响應头即可,不要用 robots.txt 的 Disallow 去屏蔽。同时保證入口頁返回 200、正文可解析、連結是标准 a 标簽的绝對路径。
如果入口頁本身没什么價值、數量又很大,更合适的做法是收敛入口頁數量、按主题组织,而不是靠 noindex 堆量。noindex 只是索引层面的一個開關,它既不保證收錄,也不承诺提升發現效率。