站内链接上动 nofollow,很多站点是顺手加的:分页加、筛选加、帮助页加,时间一长自己都记不清哪些链接被屏蔽。结果就是蜘蛛在站内走到某个位置后无路可走,一部分页面长期没有人访问。这篇文章说清楚 nofollow 在抓取路径里到底起什么作用,哪些位置值得用、哪些位置最好别碰。
nofollow 到底做了什么
nofollow 是写在链接上的一个标记,意思是“这条链接我不背书”。对蜘蛛来说,它主要影响两件事:一是蜘蛛通常不会顺着这条链接去抓新的 URL,二是这条链接不传递权重信号。注意这里说的是“通常”——不同搜索引擎的处理细节并不完全一样,有的会在其他信号足够强时仍然去抓。
关键点在于:nofollow 影响的是“顺着链接走”这个动作,不是页面本身。目标页面如果通过其他路径能到达,照样会被抓。所以用 nofollow 来“阻止某个页面被抓”是不可靠的做法,那个需求应该交给 robots.txt 或 noindex。
内链里常见的 nofollow 误用
分页链接
有些站点把“下一页”“末页”整排加上 nofollow,理由是怕抓取配额被列表页吃掉。但列表页往往是新内容唯一的入口,把翻页掐掉,等于让深层的文章页失去被发现的机会。真要控制,应该限制翻页层数、把无效的排序参数去掉,而不是把翻页链接一刀切屏蔽。
导航、面包屑和分类入口
这几处是站内抓取的主干道。在这里加 nofollow,蜘蛛能到的地方会明显缩水。除非某个入口指向的是完全不希望被抓的内容,否则不要动。
登录、注册、帮助、隐私条款
这些页面通常不需要参与排名,用 nofollow 处理是可以的,但要确认它们不是别的页面的唯一入口。如果帮助中心里藏着有搜索价值的说明文档,整块加 nofollow 会把文档一起挡在外面。
被 nofollow 的链接,蜘蛛仍然可能发现
这点常被忽略。蜘蛛发现 URL 的途径不止一条:外部链接、Sitemap、其他页面的普通链接,甚至用户提交。一条 nofollow 链接只是让蜘蛛少了一条路径,不等于把这个 URL 从互联网上抹掉。反过来讲,如果某个 URL 你确实不想被抓,光加 nofollow 是不够的。
判断标准很简单:你是想让蜘蛛别跟这条链接,还是想让这个页面别被抓?前者用 nofollow,后者用 robots.txt 或 noindex,两者不要混着用。
加之前先问三个问题
- 屏蔽这条链接后,目标页面还有没有别的入口?如果没有,就是切断了路径。
- 这个页面是真的没有价值,还是只是暂时不想让它参与排名?前者可以 nofollow,后者考虑 noindex。
- 是整块加还是逐条加?整块加容易误伤,逐条加更可控。
路径完整比单点设置更重要
蜘蛛进站之后靠链接一步步走。一条 nofollow 本身不致命,致命的是几条叠在一起,让某个栏目从入口到正文之间出现断层。所以做完设置后,最好自己从首页点进去,看能不能只用普通链接走到每一个重要页面。走得通,说明路径没问题;走不通,那条路对蜘蛛多半也断了。
定期回头看一遍
nofollow 最容易出问题的地方不是加错,而是加了之后没人再检查。改版、换模板、上新栏目时,旧规则可能还在生效。建议每隔一段时间从模板层搜一遍 nofollow,看看哪些还在用、是否仍然合理。同时对照服务器日志,留意那些长期没有蜘蛛访问的页面,它们很可能就是被某条 nofollow 或死链挡在了外面。