在蜘蛛池的入口页上,noindex,follow 是经常被拿来测试的一组指令。有人希望入口页本身不被收录,同时又能把里面的目标 URL 交给搜索蜘蛛。这个思路在逻辑上成立,但实际表现和“入口页能被正常收录”并不一样,需要把几件事分开看。
noindex 和 nofollow 是两件事
noindex 的意思是“不要把当前页面放进索引”,它管的是页面本身的收录状态。nofollow 管的是页面上的链接关系,告诉爬虫不必沿着这些链接继续跟踪。两者可以单独出现,也可以组合。入口页写 noindex,follow,等于说:这个页面我不要索引,但页面上的链接你可以继续跟。
搜索蜘蛛实际会做什么
- 页面可以被抓取,HTML 会被读取;
- 页面上的常规超链接通常仍会被发现,进入待抓取队列;
- 当前入口页不会被放进搜索结果,也不参与常规的索引状态。
所以,回答核心问题:目标 URL 仍有被发现的机会。但“被发现”和“被收录”是两回事,发现只是进入队列,后续还要看目标 URL 自己的质量、服务器响应、历史表现等。
和 robots.txt Disallow 的区别
robots.txt 的 Disallow 是禁止抓取。禁止之后,爬虫通常不会去读这个页面的 HTML,也就读不到里面的链接。noindex,follow 允许抓取,只是要求不索引当前页,因此链接仍然可能被读到。两者不要混着用:如果一个 URL 同时被 Disallow 和 noindex 覆盖,爬虫可能看不到 noindex 指令,页面反而可能因为外部链接被索引。
对目标 URL 发现的实际影响
入口页不进入索引,会带来几个间接变化:
- 入口页在站内和搜索结果中都没有展示,长期来看,搜索蜘蛛重新抓取这个入口页的优先级可能下降;
- 入口页没有索引状态,页面积累的链接信号更多停留在“传出去”这一层,入口页自身不会成为一个被持续维护的节点;
- 目标 URL 的发现节奏可能比正常收录的入口页慢,尤其是入口页数量少、更新频率低的时候。
换句话说,noindex,follow 可以用,但不要把它当成“既隐藏入口页又保留所有传链效果”的免费方案。
哪些场景适合用
如果入口页是大量低质聚合、参数页、临时页,不希望它们污染索引,同时又想保留链接发现路径,noindex,follow 是比较常见的选择。此时重点应放在:控制入口页数量、保证 HTML 可读、链接使用标准超链接、避免同时加 nofollow、不要指望目标 URL 因此快速收录。
常见误区
把 noindex 当成 nofollow 用,或者把两者一起加上,结果既没索引页面,也没把链接传出去。
还有一种是入口页 noindex 之后,页面内容长期不更新,爬虫来访频率越来越低,最后连目标 URL 的发现都变得很慢。这种情况下,与其反复调整指令,不如重新评估入口页是否还有存在价值。
总结:noindex,follow 不会直接切断目标 URL 的发现路径,但会改变入口页在抓取体系里的角色。它适合处理“页面不想被收录”的问题,不适合作为提升收录的捷径。