常见问题

入口页设了 noindex,搜索蜘蛛还会顺着链接抓目标 URL 吗?

入口页加 noindex 是常见做法,但它管的是页面收不收录,不是链接跟不跟随。本文拆开讲 noindex 与 nofollow、robots.txt 的区别,说明不同组合下搜索蜘蛛对入口页链接的处理差异,以及对蜘蛛池入口页实际抓取路径的影响和验证方法。

常见问题

入口页设了 noindex,搜索蜘蛛还会顺着链接抓目标 URL 吗?

给蜘蛛池入口页加 noindex 是很多人会做的事:入口页本身没什么内容,不想让它占搜索结果的位置,又希望它继续给目标 URL 导蜘蛛。这个想法能不能成立,取决于 noindex 到底管什么,以及搜索蜘蛛是怎么读到一个页面的。

noindex 管的是“收不收”,不是“走不走”

noindex 是页面级的索引指令,作用是告诉搜索引擎:这个页面不要出现在搜索结果里。它并不直接规定页面上的链接要不要被跟随。也就是说,一个被 noindex 的页面,本身不参与排名,但页面里出现的链接仍有被发现的机会。

和 nofollow 的区别要分清:nofollow 挂在链接上,表达的是“别把这条链接当作推荐信号”;noindex 挂在页面上,表达的是“别收录这个页面”。两者作用的对象不一样,别指望用一个指令解决另一个问题。

搜索蜘蛛还会不会跟链接

情况一:页面能正常读取,只有 noindex

页面返回 200、HTML 能被正常抓取,noindex 只影响收录判断。页面里的普通链接通常仍会被发现并进入抓取队列。但进入队列不等于一定被抓,是否真去抓目标 URL,还要看目标 URL 的质量、当次配额、优先级等因素,没有保证。

情况二:robots.txt 屏蔽了入口页

如果 robots.txt 直接屏蔽入口页,搜索蜘蛛一般不会去读取页面内容,也就读不到 noindex,同时页面里的链接也不容易被发现。这时把希望寄托在 noindex 上是没有意义的,两个机制的作用范围完全不同。

情况三:noindex 和 nofollow 一起用

页面级 noindex 加链接级 nofollow,等于把“别收录这个页”和“别跟着这条链接走”都说了。目标 URL 就只能靠 sitemap、外链、主动提交等其他路径被发现,入口页本身基本不再承担发现职责。

对蜘蛛池入口页意味着什么

  • 如果入口页主要靠自然搜索排名带来蜘蛛,noindex 会掐掉这条路径,蜘蛛来的频率通常会明显下降。
  • 如果入口页靠外链、sitemap、主动提交等方式被访问,页面被抓后链接仍可能被发现,但发现不等于被抓,更不等于目标 URL 会被收录。
  • 入口页被 noindex 后,它自己的排名和点击数据都会消失,后续判断入口页有没有起作用,只能靠日志里目标 URL 的抓取记录。

几个容易踩的细节

  • meta noindex 和 HTTP 头里的 X-Robots-Tag 冲突时,通常以更严格的一侧为准。
  • 入口页如果同时写了 canonical 指向目标 URL,再叠加 noindex,指令之间会互相打架,搜索引擎可能按自己的理解处理,结果不好预测。
  • 靠 JavaScript 动态插入的 noindex 不一定能被识别到,放在 HTML 头部更稳妥。
  • noindex 页面如果被大量链接指向,会白白消耗一部分抓取配额在不会入库的页面上。

怎么验证,怎么选

  1. 看日志:按搜索蜘蛛的 UA 过滤入口页和目标 URL,观察目标 URL 的抓取频次和返回码变化。
  2. 用站长工具:URL 检查或抓取测试能看到页面被读取时识别到的指令,但它只反映单次测试,不代表长期行为。
  3. 做对比观察:拿几组入口页分组,一组 noindex,一组不加,观察目标 URL 被抓取的情况差异。
noindex 解决的是“页面要不要出现在搜索结果里”,不是“链接要不要被爬”。想控制链接跟随,用 nofollow、robots.txt 或干脆不输出链接,比靠 noindex 更直接。

小结

入口页设 noindex 之后,只要页面还能被正常读取,里面的目标链接通常仍有被发现的机会,但抓不抓、抓多少、目标页最终能不能被收录,都没有保证。入口页需要承担“被抓取”这个职责时,先想清楚它靠什么路径被访问,再决定要不要 noindex。