做蜘蛛池入口頁时,很多人會問:给入口頁加上 noindex,是不是就等于告诉搜尋蜘蛛「別来」,連結也就白放了?答案没那么绝對。先把三件事拆開看:能不能抓取、要不要收錄、會不會跟進連結。noindex 只管第二件事。
noindex 到底管什么
noindex 的准确含义是「不要把本頁放進索引」。它不阻止抓取,也不自動阻止連結被發現。搜尋蜘蛛仍然可以訪問该 URL、讀取 HTML、把頁面上的連結加入待抓取队列。也就是说,noindex 不等于不抓取,也不等于不跟進連結。
想阻止抓取,用的是 robots.txt 的 Disallow,或者针對連結的 nofollow;想阻止索引,才用 noindex。两者作用层級不同,混着用容易得到意外结果。
實际排查里最常见的誤解,就是以為入口頁加了 noindex,搜尋蜘蛛就不會再来了。日誌里依舊能看到它抓取,這恰恰是正常表現。
两種寫法效果基本等價
声明 noindex 有两種常见方式:
- 在 HTML 里用 meta robots 标簽,content 中寫明 noindex;
- 在 HTTP 响應头里用 X-Robots-Tag,值為 noindex。
两者對主流搜尋引擎的作用大体一致,区別在于响應头對各種文件類型都有效,meta 只對 HTML 生效。响應头還能针對特定 UA 單獨設定,但這样做要谨慎,容易被認為是刻意区分来源。
入口頁用 noindex 是好主意吗
入口頁的定位是連結中轉,本身通常不需要參與排名,用 noindex 让它不占用索引位置,逻辑上说得通。但有几件事要認清:
- 抓取预算照常消耗。搜尋蜘蛛仍要下载入口頁 HTML 才能讀到連結,noindex 省不掉這次請求。
- 連結能否被發現,取决于頁面可訪問、連結可解析。noindex 不會削弱這一点。
- noindex 不能「洗白」連結頁。如果入口頁本身内容單薄、外鏈集中,noindex 也改變不了它在連結分析中的角色。
別和 nofollow 搞混
如果目标是让搜尋蜘蛛不跟進頁面里的某條連結,應该用 rel 的 nofollow 值,或者响應头里的 nofollow、none,而不是 noindex。noindex 针對頁面,nofollow 针對連結。两者可以叠加,叠加之後那條連結就不再算作可發現的路径。
還有一種常见组合是 noindex 加 follow:允许跟進連結,但不索引本頁。這種寫法在入口頁里出現得最多,也最贴合入口頁的功能定位。
怎么確認它真的在跟進
- 看服務器日誌:noindex 頁面的抓取是否持續,抓完之後目标 URL 有没有新的訪問记錄。
- 看抓取統計:入口頁通常落在「已抓取未收錄」或「被 noindex 排除」這一類里,属于预期現象。
- 看目标頁:如果目标頁長期完全没有抓取记錄,問题多半出在連結可發現性或站点整体质量上,而不是 noindex 本身。
几個容易踩的点
- noindex 需要蜘蛛真正抓到頁面才生效,不要指望它立刻起效。
- 如果同时用 robots.txt 屏蔽入口頁,蜘蛛既讀不到 noindex,也讀不到連結,等于双重阻断,反而两头落空。
- 入口頁數量很大时,批量使用 noindex 是常規操作,但不要把它当成掩盖质量問题的工具。
回到最初的問题:入口頁加 noindex,搜尋蜘蛛依然可能抓取並跟進連結,它改變的是索引狀態,不是發現路径。真想把某條連結排除,用 nofollow;真想阻止抓取,用 robots.txt。三者各管一段,先想清楚要的是哪一段,再决定寫哪種。