常见問题

入口頁设了 noindex,搜尋蜘蛛還會顺着連結爬到目标 URL 吗?

入口頁加上 noindex 之後,不少人担心蜘蛛不再進来,頁面里的目标連結也就断了。其實抓取和索引是两條不同的线:noindex 只针對頁面自身是否進索引,並不等于禁止跟随連結。真正會切断爬取鏈路的,是 robots.txt 屏蔽、nofollow 設定以及非常規的跳轉寫法。下面把這几種情况分開说清楚。

常见問题

入口頁设了 noindex,搜尋蜘蛛還會顺着連結爬到目标 URL 吗?

在蜘蛛池和入口頁运营里,「頁面要不要设 noindex」是個经常被問到的問题。提問的動机通常有两種:一種是不想让入口頁本身出現在搜尋结果里,顯得站点内容很杂;另一種是担心入口頁被判定為低质量頁面,干脆先把它藏起来。但很多人忽略了一個前提——noindex 管的是「這個頁面要不要進索引」,它並不直接等于「蜘蛛不要来抓」。這两件事混在一起,就容易做出错誤的配置。

先把抓取、索引、跟随三件事分開

搜尋蜘蛛處理一個 URL 时,大致會经歷抓取、解析、决定是否索引、是否繼續跟随連結几個环节。不同指令作用的环节並不一样:

  • robots.txt 的 Disallow:作用在抓取之前。被屏蔽的 URL,蜘蛛一般不會去請求,自然也就讀不到頁面里的任何連結。這是最硬的一道门。
  • meta robots 的 noindex:作用在抓取之後。頁面已经被讀進来了,只是不把它作為可展示的搜尋结果保留。在多數情况下,蜘蛛仍然會解析頁面内容並跟随其中的連結。
  • nofollow / meta robots nofollow:直接作用在連結跟随环节。不管頁面是否被索引,只要标记了不跟随,里面的連結就基本不會被当作發現新 URL 的线索。

所以判断「入口頁设 noindex 會不會影响目标 URL 被發現」,關键要看你有没有同时動到抓取或跟随這两层。

noindex 的入口頁,通常還能带出目标 URL

如果只加了 noindex 而没加 nofollow,入口頁本身不進索引,但頁面里的标准連結仍然有机會被蜘蛛取走。這也是為什么一些站点會用「入口頁不進索引、只做 URL 發現」的做法。

不過這里有两個現實前提值得注意。第一,連結必须是常規的 a 标簽寫法,如果連結是按钮上的 JS 点击事件、onclick 跳轉或表單提交,蜘蛛本来就不一定會执行,和 noindex 無關。第二,noindex 頁面長期不參與索引,蜘蛛對它的回訪节奏可能保持在較低水平,新加的連結被發現得會慢一些,這一点要有心理预期,不要指望当天上线当天被抓。

這些設定才會真正切断鏈路

  • robots.txt 里屏蔽了入口頁所在目錄或整站,蜘蛛连頁面都拿不到。
  • 頁面 meta 寫成 noindex, nofollow 或 none,等于同时關掉了索引和跟随。
  • HTTP 响應头里带 X-Robots-Tag: nofollow,這類設定寫在服務器配置里,頁面源碼看不出来,很容易被忽略。
  • 目标連結本身加了 rel="nofollow",即便入口頁完全正常,這條鏈路也断了。
  • 連結通過跳轉服務、短鏈平台或多层 302 中轉,增加了蜘蛛跟丢的概率。

想「不進索引但保留爬取」该怎么寫

  1. 頁面头部使用 noindex, follow,明确表達只排除索引,不排除跟随。
  2. 检查 robots.txt,確認没有誤伤入口頁路径,尤其注意通配符和目錄級屏蔽。
  3. 检查服務器返回头,確認没有被全局注入 nofollow 類的 X-Robots-Tag。
  4. 確認目标連結是可点击的普通超連結,而不是依赖脚本才能生成的引用。
  5. 上线後用搜尋引擎的抓取測試或 URL 检查類工具看一眼:頁面能否被抓取、有没有识別出站内連結。

两個常见誤区

誤区一:noindex 等于蜘蛛不會来

這两者的层級不同。noindex 是抓取之後的處理决定,蜘蛛该請求還是要請求。真正让蜘蛛不来的,是 robots.txt 的屏蔽,或者服務器直接拒绝訪問。

誤区二:noindex, follow 能保住連結價值

follow 只表示「可以繼續跟」,它解决的是 URL 發現的問题,並不等于被跟随的連結會获得和其他索引頁面同等的對待。把入口頁当作發現通道是合理的,把它当作權重中轉站則没有依據。

把入口頁当成「让蜘蛛知道有這么一個 URL 存在」的通道,比把它当成提升排名的工具,更接近它實际能起到的作用。

一份简單的自查顺序

  • 先看 robots.txt,確認入口頁没有被屏蔽。
  • 再看頁面 meta robots 和响應头 X-Robots-Tag,確認没有誤加 nofollow。
  • 检查目标連結的 rel 属性和寫法,確認是可正常跟随的連結。
  • 用工具確認入口頁可被抓取、能识別出目标連結。
  • 观察一段時間内目标 URL 是否出現在抓取日誌里,再决定要不要調整入口頁數量或更新频率。

總结一句:noindex 本身通常不會切断入口頁到目标 URL 的鏈路,真正需要盯住的是 robots.txt、nofollow 和連結寫法這三處。搞清楚哪條指令管哪個环节,比反复猜测蜘蛛的行為要可靠得多。