搜索抓取

nofollow 链接里的 URL:蜘蛛是彻底忽略,还是先记下再说

nofollow 常被当成让蜘蛛别抓的开关,但它更像一个提示。本文梳理 nofollow 链接里的 URL 会不会被蜘蛛发现、什么时候会被记入待抓队列,以及重要页面应该用哪些更稳定的通道递线索。

搜索抓取

nofollow 链接里的 URL:蜘蛛是彻底忽略,还是先记下再说

在页面里给链接加上 rel="nofollow",是很多站点控制外链和低价值链接的常规操作。但一个常见误解是:加了 nofollow,蜘蛛就不会抓到那个 URL,甚至不会把它放进待抓队列。实际更接近“提示”——它主要影响链接关系的传递,不负责阻止抓取。

nofollow 管的是链接关系,不是抓取开关

nofollow 的语义是告诉搜索引擎“这个链接不是站点的背书”。它和 robots.txt 的 Disallow、页面上的 robots meta noindex 不是一回事。蜘蛛解析页面时,仍然可能看到这个链接的 href,并把它当作一条 URL 线索。是否继续抓取、什么时候抓,取决于这条线索的优先级、站点抓取额度、页面更新情况等因素。

把 nofollow 当成“禁止抓取”使用,往往会得到相反的效果:你以为切断了路径,实际只是让这条路径变得不稳定。

蜘蛛看到 nofollow 后,通常会做几件事

  • 记录这个 URL:尤其是站内链接,蜘蛛可能仍会把它放入待抓池,只是不把它当作强推荐。
  • 降低优先级:如果同一个 URL 没有其他可抓取内链或 Sitemap 线索,它可能排得很后。
  • 继续解析页面:抓取后是否索引,还要看页面本身、robots meta、内容质量等条件。
  • 参考其他信号:Sitemap、站内其他链接、外链、历史抓取记录,都会影响蜘蛛是否回来。

站内重要链接,不要只靠 nofollow 递线索

如果分类页、详情页、帮助中心这类需要被发现的页面,只出现在 nofollow 链接里,蜘蛛仍可能通过其他方式找到它,但发现路径会变窄。更稳妥的做法是:给重要 URL 留至少一条普通可抓取内链,同时用 XML Sitemap 做兜底。nofollow 可以用于评论区外链、明显低价值的推广位,或者你不想传递权重的关系,但不要让整站导航和核心内容路径都带上它。

和 Sitemap、内链一起看,才能判断线索有没有断

检查时不要只盯着 rel="nofollow" 这个属性。可以按下面的顺序排查:

  1. 看服务器日志里有没有蜘蛛来过这个 URL,以及它从哪个 referer 过来。
  2. 看 Search Console 的链接报告和 Sitemap 覆盖情况,确认 URL 是否已被发现。
  3. 看内链结构:重要页面是否只有 nofollow 入口,有没有普通链接或 Sitemap 补充。
  4. 看 robots.txt 和页面 robots meta,确认没有把“不抓取”和“不索引”混在一起设置。

常见误区:nofollow 能省抓取额度,也可能漏掉页面

给大量筛选参数、排序参数加 nofollow,确实可以减少蜘蛛在这些组合 URL 上反复绕路。但如果这些参数页里藏着有价值的详情页入口,nofollow 之后蜘蛛可能不再顺着走,详情页就只能靠 Sitemap 或其他内链被发现。换句话说,nofollow 能收窄抓取路径,也可能让一批 URL 的线索变弱。取舍时要看这些 URL 是否还需要被发现。

结论:把 nofollow 当提示,把发现通道留给稳定入口

蜘蛛看到 nofollow 链接时,通常不会像遇到 robots 拦截那样直接停下。它可能记下 URL,也可能因为优先级低而暂时不抓。对站点运营来说,更值得做的是:核心页面用普通内链和 Sitemap 稳定递线索,低价值链接再用 nofollow 控制关系传递。这样既不会误伤抓取路径,也能让有限的抓取资源更集中。