網站收錄

内鏈加了 nofollow 之後:URL 發現路径與收錄狀態的核對顺序

内鏈加上 nofollow 之後收錄出現變化,問题往往出在發現路径而不是禁令。本文把連結属性、抓取規則與頁面指令分開来看,並给出一套從属性確認、入口排查到日誌比對的核對顺序,帮你在發現不足與质量不足之間做出判断。

網站收錄

内鏈加了 nofollow 之後:URL 發現路径與收錄狀態的核對顺序

站内連結加了 rel="nofollow",頁面還是照常被抓、照常被索引,于是有人得出结论:nofollow 對收錄没有影响。另一種情况刚好相反,某批頁面加了 nofollow 之後,抓取和收錄一起掉了,又有人断定 nofollow 就是禁止收錄。這两種结论都不完整,因為 nofollow 作用在連結上,而收錄作用在 URL 上,中間還隔着發現這一环。

先把三個概念分開

nofollow 是連結属性,它描述的是這條連結不背书,逻辑上並不禁止搜尋引擎訪問目标 URL。noindex 是頁面級指令,寫在目标頁面自己的 head 里,明确要求不要索引。robots.txt 属于抓取层規則,控制的是能不能抓。三者可以叠加,也经常被混用。

判断問题时先問一句:現在丢的是哪一环。是蜘蛛不再發現這個 URL,是發現了不抓,是抓了不索引,還是索引了不展示。不同环节對應的處理方式完全不同。

nofollow 影响的主要是發現路径

不同搜尋引擎對 nofollow 連結的處理方式存在差异,而且這種差异會随场景變化。常见的情况是:連結仍然可能被跟随用于發現新 URL,但不作為權重传递的依據;也有引擎在部分场景下會降低對這類連結的抓取優先級。所以同样的站内结构,nofollow 加在導航上、加在正文里、加在评论区,效果並不一样。

批量加 nofollow 的風險

真正的問题通常不是某一條 nofollow 連結,而是入口被大面积切断。如果一個頁面唯一的内鏈入口都带了 nofollow,它又不在 sitemap 里、也没有外鏈指向,那么它從低優先級變成没人知道它存在,只是時間問题。這不是禁令生效,而是發現路径消失了。

一條可执行的核對顺序

  1. 確認這條連結到底带了什么属性。nofollow、sponsored、ugc 的處理逻辑不完全相同,先看清楚頁面上真實輸出的 HTML,而不是模板里寫了什么。
  2. 統計目标 URL 還有没有別的入口。導航、面包屑、列表頁、相關推荐、sitemap、外鏈,逐個過一遍。只有一個入口的頁面本来就脆弱。
  3. 看服務器日誌里有没有抓取记錄。有抓取說明發現没問题,瓶颈更可能在後端;完全没抓取,才需要往發現路径上查。
  4. 對比 sitemap 與實际入口。如果 URL 在 sitemap 里却長期無抓取,而站内又全是 nofollow 入口,基本可以定位到發現环节。
  5. 区分是發現不足還是质量不足。恢复几條正常的站内連結之後再观察一到两個抓取周期,如果抓取恢复但索引依然不動,說明問题已经轉到頁面质量或内容重复上。

几個容易被忽略的点

  • JS 渲染出来的連結,属性可能和静態 HTML 不一致,检查时要看渲染後的 DOM。
  • 連結被 nofollow 不等于 URL 被排除,別用它代替 noindex。
  • 分頁、篩選、排序這類頁面的入口,一旦全部 nofollow,容易導致深层内容長期不被發現。
  • 改動連結属性後不要只看一天的資料,抓取和索引的反馈通常有延迟。
nofollow 更像是在調整優先級和信任關系,而不是一個開關。把它当開關用,往往既没省下抓取预算,還顺手關掉了一些頁面的入口。

什么时候确實该用

用戶生成内容里的外鏈、明顯的广告位、确實不想背书的第三方連結,這些场景用 nofollow 是合理的。站内導航和内容推荐,如果目的是让頁面被收錄,一般不该用。要控制抓取预算,優先考虑的是收敛低價值 URL 的數量和入口,而不是给正常内鏈贴标簽。

最後提醒一点:連結属性的改動是可逆的,但抓取和索引的反馈不是即时的。每次調整後留出观察窗口,把改了和生效了分開记錄,比反复试错更容易看清問题出在哪一环。