入口页通常是用模板批量生成的,模板里往往有一处统一的外链属性设置。有人习惯给所有目标链接加上 rel="nofollow",也有人担心加了之后搜索蜘蛛就不去碰了。要把这件事说清楚,得把它拆成三个层面:这个属性本身表达什么、搜索蜘蛛怎么处理它、以及最后目标 URL 有没有真的被抓到。
先把结论说在前面
nofollow 不是屏蔽开关。它不会像 robots.txt 里的 Disallow 那样禁止抓取,也不像 noindex 那样影响页面是否进入索引。链接加了这个属性,页面本身还是可以被访问、被解析,链接地址也仍然有被发现的机会。它改变的更多是搜索引擎对这个链接的“态度权重”,而不是“能不能看见”。
nofollow 表达的是不背书,不是别来抓
- 它最初的用途是告诉搜索引擎:这个链接不是本站主动推荐或背书的,常见于评论、用户投稿、广告位。
- 主流搜索引擎现在普遍把它当作一种提示来对待,具体怎么采信、采信到什么程度,并不完全公开。
- 它和 robots.txt、noindex、X-Robots-Tag 这些“禁止类”手段不是一个层级的东西,混在一起理解容易走偏。
- 一个 URL 能不能被程序看见,主要取决于它所在的页面有没有被抓取、被抓取的频率有多高、页面里的链接是不是能被正常解析出来。
发现、抓取、收录是三件事
很多人把这三件事合并成一句“被抓到了”,于是判断就乱了。发现是程序在某个页面里看到了这个地址;抓取是它真的去请求了这个地址并拿到响应;收录是抓取之后经过处理进入索引并可能出现在结果里。nofollow 主要影响的是中间那层传递,它对“发现”这一环的干扰,远比很多人想象得小。反过来说,就算链接没加 nofollow,也不代表这个 URL 一定会被抓、一定会被收录。
入口页加了 nofollow,常见会出现几种情况
- 链接仍被解析出来,目标 URL 出现在抓取日志里,只是频率和优先级可能受影响。
- 如果同一个目标 URL 在别的地方也以普通链接出现,那么它被发现的主要来源可能就变成了别处。
- 如果入口页本身抓取频率很低,那加不加这个属性,差别本来就看不出来,瓶颈在入口页自己身上。
- 如果入口页数量很大、链接很集中,属性上的细微差别更容易在日志里体现出节奏变化。
什么时候可以考虑加,什么时候没必要
- 链接来自用户可编辑区域、广告位、付费位置时,按规范加 nofollow 是合理做法,这是在说明关系,不是在藏东西。
- 链接是你自己站点结构里主动给出的导航或内容引用,通常不加更符合语义。
- 如果你的目的只是“不想让某个地址被抓”,那应该用 robots.txt 或页面级禁止手段,加 nofollow 达不到这个效果。
- 如果你的目的是“希望这个地址被更多看到”,那么把精力放在入口页的可访问性、更新频率、链接位置的可见性上,收益通常比纠结属性更直接。
怎么自己验证一遍
- 对比入口页的抓取记录和目标 URL 的访问记录,看两者时间上是否接近,间隔是否稳定。
- 在入口页里放一个已知地址做对照,一组加 nofollow、一组不加,观察日志里两者出现频率有没有明显差异。
- 把同一批目标 URL 同时通过站点地图或其他正常链接暴露一次,看发现渠道是不是被单一入口页绑定。
- 用站长平台的抓取统计和 URL 检查工具交叉印证,不要只凭一次日志下结论。
需要提醒的是:nofollow 不适合当作隐藏链接或隐藏页面的手段,也不该被当成控制抓取的开关。想控制抓取,用 robots.txt;想控制收录,用 noindex;想表达关系,才轮到 nofollow。
小结
入口页的链接加不加 nofollow,影响的更多是搜索引擎怎么理解这个链接的关系,而不是它能不能看见这个地址。真正决定目标 URL 命运的,是入口页本身有没有被稳定抓取、链接能不能被正常解析、以及同一批地址是否还有别的发现渠道。把这几件事盯住,比反复调整一个属性更有意义。