给蜘蛛池入口頁加 noindex 是很多人會做的事:入口頁本身没什么内容,不想让它占搜尋结果的位置,又希望它繼續给目标 URL 導蜘蛛。這個想法能不能成立,取决于 noindex 到底管什么,以及搜尋蜘蛛是怎么讀到一個頁面的。
noindex 管的是“收不收”,不是“走不走”
noindex 是頁面級的索引指令,作用是告诉搜尋引擎:這個頁面不要出現在搜尋结果里。它並不直接規定頁面上的連結要不要被跟随。也就是说,一個被 noindex 的頁面,本身不參與排名,但頁面里出現的連結仍有被發現的机會。
和 nofollow 的区別要分清:nofollow 挂在連結上,表達的是“別把這條連結当作推荐信号”;noindex 挂在頁面上,表達的是“別收錄這個頁面”。两者作用的對象不一样,別指望用一個指令解决另一個問题。
搜尋蜘蛛還會不會跟連結
情况一:頁面能正常讀取,只有 noindex
頁面返回 200、HTML 能被正常抓取,noindex 只影响收錄判断。頁面里的普通連結通常仍會被發現並進入抓取队列。但進入队列不等于一定被抓,是否真去抓目标 URL,還要看目标 URL 的质量、当次配額、優先級等因素,没有保證。
情况二:robots.txt 屏蔽了入口頁
如果 robots.txt 直接屏蔽入口頁,搜尋蜘蛛一般不會去讀取頁面内容,也就讀不到 noindex,同时頁面里的連結也不容易被發現。這时把希望寄托在 noindex 上是没有意义的,两個机制的作用范围完全不同。
情况三:noindex 和 nofollow 一起用
頁面級 noindex 加連結級 nofollow,等于把“別收錄這個頁”和“別跟着這條連結走”都说了。目标 URL 就只能靠 sitemap、外鏈、主動提交等其他路径被發現,入口頁本身基本不再承担發現职责。
對蜘蛛池入口頁意味着什么
- 如果入口頁主要靠自然搜尋排名带来蜘蛛,noindex 會掐掉這條路径,蜘蛛来的频率通常會明顯下降。
- 如果入口頁靠外鏈、sitemap、主動提交等方式被訪問,頁面被抓後連結仍可能被發現,但發現不等于被抓,更不等于目标 URL 會被收錄。
- 入口頁被 noindex 後,它自己的排名和点击資料都會消失,後續判断入口頁有没有起作用,只能靠日誌里目标 URL 的抓取记錄。
几個容易踩的细节
- meta noindex 和 HTTP 头里的 X-Robots-Tag 冲突时,通常以更嚴格的一侧為准。
- 入口頁如果同时寫了 canonical 指向目标 URL,再叠加 noindex,指令之間會互相打架,搜尋引擎可能按自己的理解處理,结果不好预测。
- 靠 JavaScript 動態插入的 noindex 不一定能被识別到,放在 HTML 头部更稳妥。
- noindex 頁面如果被大量連結指向,會白白消耗一部分抓取配額在不會入库的頁面上。
怎么驗證,怎么選
- 看日誌:按搜尋蜘蛛的 UA 過滤入口頁和目标 URL,观察目标 URL 的抓取频次和返回碼變化。
- 用站長工具:URL 检查或抓取測試能看到頁面被讀取时识別到的指令,但它只反映單次測試,不代表長期行為。
- 做對比观察:拿几组入口頁分组,一组 noindex,一组不加,观察目标 URL 被抓取的情况差异。
noindex 解决的是“頁面要不要出現在搜尋结果里”,不是“連結要不要被爬”。想控制連結跟随,用 nofollow、robots.txt 或干脆不輸出連結,比靠 noindex 更直接。
小结
入口頁设 noindex 之後,只要頁面還能被正常讀取,里面的目标連結通常仍有被發現的机會,但抓不抓、抓多少、目标頁最终能不能被收錄,都没有保證。入口頁需要承担“被抓取”這個职责时,先想清楚它靠什么路径被訪問,再决定要不要 noindex。