网站收录

内链加了 nofollow 之后:URL 发现路径与收录状态的核对顺序

内链加上 nofollow 之后收录出现变化,问题往往出在发现路径而不是禁令。本文把链接属性、抓取规则与页面指令分开来看,并给出一套从属性确认、入口排查到日志比对的核对顺序,帮你在发现不足与质量不足之间做出判断。

网站收录

内链加了 nofollow 之后:URL 发现路径与收录状态的核对顺序

站内链接加了 rel="nofollow",页面还是照常被抓、照常被索引,于是有人得出结论:nofollow 对收录没有影响。另一种情况刚好相反,某批页面加了 nofollow 之后,抓取和收录一起掉了,又有人断定 nofollow 就是禁止收录。这两种结论都不完整,因为 nofollow 作用在链接上,而收录作用在 URL 上,中间还隔着发现这一环。

先把三个概念分开

nofollow 是链接属性,它描述的是这条链接不背书,逻辑上并不禁止搜索引擎访问目标 URL。noindex 是页面级指令,写在目标页面自己的 head 里,明确要求不要索引。robots.txt 属于抓取层规则,控制的是能不能抓。三者可以叠加,也经常被混用。

判断问题时先问一句:现在丢的是哪一环。是蜘蛛不再发现这个 URL,是发现了不抓,是抓了不索引,还是索引了不展示。不同环节对应的处理方式完全不同。

nofollow 影响的主要是发现路径

不同搜索引擎对 nofollow 链接的处理方式存在差异,而且这种差异会随场景变化。常见的情况是:链接仍然可能被跟随用于发现新 URL,但不作为权重传递的依据;也有引擎在部分场景下会降低对这类链接的抓取优先级。所以同样的站内结构,nofollow 加在导航上、加在正文里、加在评论区,效果并不一样。

批量加 nofollow 的风险

真正的问题通常不是某一条 nofollow 链接,而是入口被大面积切断。如果一个页面唯一的内链入口都带了 nofollow,它又不在 sitemap 里、也没有外链指向,那么它从低优先级变成没人知道它存在,只是时间问题。这不是禁令生效,而是发现路径消失了。

一条可执行的核对顺序

  1. 确认这条链接到底带了什么属性。nofollow、sponsored、ugc 的处理逻辑不完全相同,先看清楚页面上真实输出的 HTML,而不是模板里写了什么。
  2. 统计目标 URL 还有没有别的入口。导航、面包屑、列表页、相关推荐、sitemap、外链,逐个过一遍。只有一个入口的页面本来就脆弱。
  3. 看服务器日志里有没有抓取记录。有抓取说明发现没问题,瓶颈更可能在后端;完全没抓取,才需要往发现路径上查。
  4. 对比 sitemap 与实际入口。如果 URL 在 sitemap 里却长期无抓取,而站内又全是 nofollow 入口,基本可以定位到发现环节。
  5. 区分是发现不足还是质量不足。恢复几条正常的站内链接之后再观察一到两个抓取周期,如果抓取恢复但索引依然不动,说明问题已经转到页面质量或内容重复上。

几个容易被忽略的点

  • JS 渲染出来的链接,属性可能和静态 HTML 不一致,检查时要看渲染后的 DOM。
  • 链接被 nofollow 不等于 URL 被排除,别用它代替 noindex。
  • 分页、筛选、排序这类页面的入口,一旦全部 nofollow,容易导致深层内容长期不被发现。
  • 改动链接属性后不要只看一天的数据,抓取和索引的反馈通常有延迟。
nofollow 更像是在调整优先级和信任关系,而不是一个开关。把它当开关用,往往既没省下抓取预算,还顺手关掉了一些页面的入口。

什么时候确实该用

用户生成内容里的外链、明显的广告位、确实不想背书的第三方链接,这些场景用 nofollow 是合理的。站内导航和内容推荐,如果目的是让页面被收录,一般不该用。要控制抓取预算,优先考虑的是收敛低价值 URL 的数量和入口,而不是给正常内链贴标签。

最后提醒一点:链接属性的改动是可逆的,但抓取和索引的反馈不是即时的。每次调整后留出观察窗口,把改了和生效了分开记录,比反复试错更容易看清问题出在哪一环。