搜索抓取

内链加了 nofollow,蜘蛛还会不会沿着走

nofollow 常被当成“不让蜘蛛抓取”的开关,但它主要影响的是链接信号的传递,而不是彻底切断抓取路径。本文把 nofollow、robots.txt、noindex 的边界分开,说明蜘蛛遇到 nofollow 链接时可能怎么做,以及站内内链哪些地方适合用、哪些地方最好别用。

搜索抓取

内链加了 nofollow,蜘蛛还会不会沿着走

站内内链加不加 nofollow,是运营里经常被问到的问题。有人把它当成“不让蜘蛛走这条路”的开关,也有人听说加了 nofollow 就能集中权重,于是把大量链接统一处理。实际效果往往没有这么干脆:nofollow 主要管的是链接关系的传递,而不是把 URL 从抓取路径上彻底抹掉。

nofollow 管的是什么

从搜索引擎的角度看,一个普通链接至少包含两层信息:一是这个 URL 存在,可以被发现;二是这条链接可能代表推荐或信任关系。nofollow 主要弱化或取消后一层,也就是通常说的“不传递权重”。它并不等于把链接变成纯文本,也不保证蜘蛛一定不会访问目标地址。

所以,nofollow 不是抓取开关。蜘蛛仍然可能因为其他内链、Sitemap、外链或历史记录而发现并抓取这个 URL。加了 nofollow 只意味着这条链接在信号计算中不被当作正常推荐。

蜘蛛遇到 nofollow 链接时可能怎么做

  • 可能沿着链接抓取目标 URL,尤其当这个 URL 在站内还有其他普通链接时。
  • 可能降低沿这条链接继续深入的优先级,但不等于永久跳过。
  • 不把这条链接当作投票或信任信号,影响的是链接关系,不是服务器能不能返回页面。
  • 不同搜索引擎的实现细节有差异,没有必要把某一种表现当成绝对规则。

如果目标是“不要让这个 URL 被索引”,更直接的做法通常是 noindex 或 robots.txt 的抓取限制。如果目标是“不要让蜘蛛抓取”,robots.txt 更贴近需求,但它也管不住已经被索引的页面。几个工具各管一段,混在一起容易判断失误。

站内内链哪些地方适合用 nofollow

站内正常导航和内容推荐,一般不需要加 nofollow。首页、频道页、文章正文里的相关阅读、上一篇下一篇,这些链接承担的是发现 URL 和建立层级的作用。大量加 nofollow,可能让一些页面失去稳定的内链入口,蜘蛛发现它们的路径变少,抓取节奏也可能变慢。

比较适合考虑 nofollow 的场景通常包括:

  1. 用户评论、论坛签名、UGC 里不可控的外链,避免被当成站点推荐。
  2. 广告、赞助内容、付费合作链接,按规范标注关系。
  3. 登录、注册、购物车、后台入口等对搜索用户没有价值的页面链接,但更彻底的方式是配合 robots.txt 或 noindex。
  4. 某些筛选、排序、会话参数链接,在无法用 canonical 收口时,可以临时减少信号传递,但不要把它当成长期唯一的治理手段。

对抓取路径的实际影响

蜘蛛在站内走路径,靠的是可抓取的普通链接。如果某个频道的内容都通过 nofollow 链接串联,蜘蛛仍可能从 Sitemap 或其他入口找到部分 URL,但缺少内链上下文,抓取深度和频率往往不如正常链接稳定。反过来,如果所有重要页面都有清晰的普通内链,nofollow 只用在该用的地方,路径就不会被自己切断。

判断标准可以简单一点:这条链接是给用户导航、帮助蜘蛛发现内容的,就保持普通链接;这条链接是广告、不可信来源或纯操作入口,再考虑 nofollow 或更合适的限制方式。

怎么验证有没有走偏

与其猜,不如看抓取日志和搜索控制台里的抓取统计。重点观察:目标 URL 是否仍有抓取记录,抓取来源是不是主要靠 Sitemap,内链页面的蜘蛛访问是否明显减少。如果发现重要页面长期缺少内链入口,先把内链恢复成普通链接,比反复调整 nofollow 更有效。

nofollow 是一个信号工具,不是路径开关。把它的边界放对位置,内链结构、Sitemap 和抓取路径才能各司其职。