常见问题

入口页设了 noindex,搜索蜘蛛还会顺着链接爬到目标 URL 吗?

入口页加上 noindex 之后,不少人担心蜘蛛不再进来,页面里的目标链接也就断了。其实抓取和索引是两条不同的线:noindex 只针对页面自身是否进索引,并不等于禁止跟随链接。真正会切断爬取链路的,是 robots.txt 屏蔽、nofollow 设置以及非常规的跳转写法。下面把这几种情况分开说清楚。

常见问题

入口页设了 noindex,搜索蜘蛛还会顺着链接爬到目标 URL 吗?

在蜘蛛池和入口页运营里,「页面要不要设 noindex」是个经常被问到的问题。提问的动机通常有两种:一种是不想让入口页本身出现在搜索结果里,显得站点内容很杂;另一种是担心入口页被判定为低质量页面,干脆先把它藏起来。但很多人忽略了一个前提——noindex 管的是「这个页面要不要进索引」,它并不直接等于「蜘蛛不要来抓」。这两件事混在一起,就容易做出错误的配置。

先把抓取、索引、跟随三件事分开

搜索蜘蛛处理一个 URL 时,大致会经历抓取、解析、决定是否索引、是否继续跟随链接几个环节。不同指令作用的环节并不一样:

  • robots.txt 的 Disallow:作用在抓取之前。被屏蔽的 URL,蜘蛛一般不会去请求,自然也就读不到页面里的任何链接。这是最硬的一道门。
  • meta robots 的 noindex:作用在抓取之后。页面已经被读进来了,只是不把它作为可展示的搜索结果保留。在多数情况下,蜘蛛仍然会解析页面内容并跟随其中的链接。
  • nofollow / meta robots nofollow:直接作用在链接跟随环节。不管页面是否被索引,只要标记了不跟随,里面的链接就基本不会被当作发现新 URL 的线索。

所以判断「入口页设 noindex 会不会影响目标 URL 被发现」,关键要看你有没有同时动到抓取或跟随这两层。

noindex 的入口页,通常还能带出目标 URL

如果只加了 noindex 而没加 nofollow,入口页本身不进索引,但页面里的标准链接仍然有机会被蜘蛛取走。这也是为什么一些站点会用「入口页不进索引、只做 URL 发现」的做法。

不过这里有两个现实前提值得注意。第一,链接必须是常规的 a 标签写法,如果链接是按钮上的 JS 点击事件、onclick 跳转或表单提交,蜘蛛本来就不一定会执行,和 noindex 无关。第二,noindex 页面长期不参与索引,蜘蛛对它的回访节奏可能保持在较低水平,新加的链接被发现得会慢一些,这一点要有心理预期,不要指望当天上线当天被抓。

这些设置才会真正切断链路

  • robots.txt 里屏蔽了入口页所在目录或整站,蜘蛛连页面都拿不到。
  • 页面 meta 写成 noindex, nofollow 或 none,等于同时关掉了索引和跟随。
  • HTTP 响应头里带 X-Robots-Tag: nofollow,这类设置写在服务器配置里,页面源码看不出来,很容易被忽略。
  • 目标链接本身加了 rel="nofollow",即便入口页完全正常,这条链路也断了。
  • 链接通过跳转服务、短链平台或多层 302 中转,增加了蜘蛛跟丢的概率。

想「不进索引但保留爬取」该怎么写

  1. 页面头部使用 noindex, follow,明确表达只排除索引,不排除跟随。
  2. 检查 robots.txt,确认没有误伤入口页路径,尤其注意通配符和目录级屏蔽。
  3. 检查服务器返回头,确认没有被全局注入 nofollow 类的 X-Robots-Tag。
  4. 确认目标链接是可点击的普通超链接,而不是依赖脚本才能生成的引用。
  5. 上线后用搜索引擎的抓取测试或 URL 检查类工具看一眼:页面能否被抓取、有没有识别出站内链接。

两个常见误区

误区一:noindex 等于蜘蛛不会来

这两者的层级不同。noindex 是抓取之后的处理决定,蜘蛛该请求还是要请求。真正让蜘蛛不来的,是 robots.txt 的屏蔽,或者服务器直接拒绝访问。

误区二:noindex, follow 能保住链接价值

follow 只表示「可以继续跟」,它解决的是 URL 发现的问题,并不等于被跟随的链接会获得和其他索引页面同等的对待。把入口页当作发现通道是合理的,把它当作权重中转站则没有依据。

把入口页当成「让蜘蛛知道有这么一个 URL 存在」的通道,比把它当成提升排名的工具,更接近它实际能起到的作用。

一份简单的自查顺序

  • 先看 robots.txt,确认入口页没有被屏蔽。
  • 再看页面 meta robots 和响应头 X-Robots-Tag,确认没有误加 nofollow。
  • 检查目标链接的 rel 属性和写法,确认是可正常跟随的链接。
  • 用工具确认入口页可被抓取、能识别出目标链接。
  • 观察一段时间内目标 URL 是否出现在抓取日志里,再决定要不要调整入口页数量或更新频率。

总结一句:noindex 本身通常不会切断入口页到目标 URL 的链路,真正需要盯住的是 robots.txt、nofollow 和链接写法这三处。搞清楚哪条指令管哪个环节,比反复猜测蜘蛛的行为要可靠得多。