搜索抓取

nofollow 与内链:哪些链接蜘蛛会跟,哪些会被跳过

nofollow 常被当成万能开关,用错了会把站内抓取路径切断。本文说明 nofollow 对蜘蛛的实际作用,梳理分页、导航、帮助页等位置的使用取舍,并区分它与 robots.txt、noindex 的分工,帮你判断哪些内链该让蜘蛛继续跟下去。

搜索抓取

nofollow 与内链:哪些链接蜘蛛会跟,哪些会被跳过

站内链接上动 nofollow,很多站点是顺手加的:分页加、筛选加、帮助页加,时间一长自己都记不清哪些链接被屏蔽。结果就是蜘蛛在站内走到某个位置后无路可走,一部分页面长期没有人访问。这篇文章说清楚 nofollow 在抓取路径里到底起什么作用,哪些位置值得用、哪些位置最好别碰。

nofollow 到底做了什么

nofollow 是写在链接上的一个标记,意思是“这条链接我不背书”。对蜘蛛来说,它主要影响两件事:一是蜘蛛通常不会顺着这条链接去抓新的 URL,二是这条链接不传递权重信号。注意这里说的是“通常”——不同搜索引擎的处理细节并不完全一样,有的会在其他信号足够强时仍然去抓。

关键点在于:nofollow 影响的是“顺着链接走”这个动作,不是页面本身。目标页面如果通过其他路径能到达,照样会被抓。所以用 nofollow 来“阻止某个页面被抓”是不可靠的做法,那个需求应该交给 robots.txt 或 noindex。

内链里常见的 nofollow 误用

分页链接

有些站点把“下一页”“末页”整排加上 nofollow,理由是怕抓取配额被列表页吃掉。但列表页往往是新内容唯一的入口,把翻页掐掉,等于让深层的文章页失去被发现的机会。真要控制,应该限制翻页层数、把无效的排序参数去掉,而不是把翻页链接一刀切屏蔽。

导航、面包屑和分类入口

这几处是站内抓取的主干道。在这里加 nofollow,蜘蛛能到的地方会明显缩水。除非某个入口指向的是完全不希望被抓的内容,否则不要动。

登录、注册、帮助、隐私条款

这些页面通常不需要参与排名,用 nofollow 处理是可以的,但要确认它们不是别的页面的唯一入口。如果帮助中心里藏着有搜索价值的说明文档,整块加 nofollow 会把文档一起挡在外面。

被 nofollow 的链接,蜘蛛仍然可能发现

这点常被忽略。蜘蛛发现 URL 的途径不止一条:外部链接、Sitemap、其他页面的普通链接,甚至用户提交。一条 nofollow 链接只是让蜘蛛少了一条路径,不等于把这个 URL 从互联网上抹掉。反过来讲,如果某个 URL 你确实不想被抓,光加 nofollow 是不够的。

判断标准很简单:你是想让蜘蛛别跟这条链接,还是想让这个页面别被抓?前者用 nofollow,后者用 robots.txt 或 noindex,两者不要混着用。

加之前先问三个问题

  • 屏蔽这条链接后,目标页面还有没有别的入口?如果没有,就是切断了路径。
  • 这个页面是真的没有价值,还是只是暂时不想让它参与排名?前者可以 nofollow,后者考虑 noindex。
  • 是整块加还是逐条加?整块加容易误伤,逐条加更可控。

路径完整比单点设置更重要

蜘蛛进站之后靠链接一步步走。一条 nofollow 本身不致命,致命的是几条叠在一起,让某个栏目从入口到正文之间出现断层。所以做完设置后,最好自己从首页点进去,看能不能只用普通链接走到每一个重要页面。走得通,说明路径没问题;走不通,那条路对蜘蛛多半也断了。

定期回头看一遍

nofollow 最容易出问题的地方不是加错,而是加了之后没人再检查。改版、换模板、上新栏目时,旧规则可能还在生效。建议每隔一段时间从模板层搜一遍 nofollow,看看哪些还在用、是否仍然合理。同时对照服务器日志,留意那些长期没有蜘蛛访问的页面,它们很可能就是被某条 nofollow 或死链挡在了外面。