搜尋抓取

nofollow 與内鏈:哪些連結蜘蛛會跟,哪些會被跳過

nofollow 常被当成萬能開關,用错了會把站内抓取路径切断。本文說明 nofollow 對蜘蛛的實际作用,梳理分頁、導航、帮助頁等位置的使用取舍,並区分它與 robots.txt、noindex 的分工,帮你判断哪些内鏈该让蜘蛛繼續跟下去。

搜尋抓取

nofollow 與内鏈:哪些連結蜘蛛會跟,哪些會被跳過

站内連結上動 nofollow,很多站点是顺手加的:分頁加、篩選加、帮助頁加,時間一長自己都记不清哪些連結被屏蔽。结果就是蜘蛛在站内走到某個位置後無路可走,一部分頁面長期没有人訪問。這篇文章说清楚 nofollow 在抓取路径里到底起什么作用,哪些位置值得用、哪些位置最好別碰。

nofollow 到底做了什么

nofollow 是寫在連結上的一個标记,意思是“這條連結我不背书”。對蜘蛛来说,它主要影响两件事:一是蜘蛛通常不會顺着這條連結去抓新的 URL,二是這條連結不传递權重信号。注意這里说的是“通常”——不同搜尋引擎的處理细节並不完全一样,有的會在其他信号足够强时仍然去抓。

關键点在于:nofollow 影响的是“顺着連結走”這個動作,不是頁面本身。目标頁面如果通過其他路径能到達,照样會被抓。所以用 nofollow 来“阻止某個頁面被抓”是不可靠的做法,那個需求應该交给 robots.txt 或 noindex。

内鏈里常见的 nofollow 誤用

分頁連結

有些站点把“下一頁”“末頁”整排加上 nofollow,理由是怕抓取配額被列表頁吃掉。但列表頁往往是新内容唯一的入口,把翻頁掐掉,等于让深层的文章頁失去被發現的机會。真要控制,應该限制翻頁层數、把無效的排序參數去掉,而不是把翻頁連結一刀切屏蔽。

導航、面包屑和分類入口

這几處是站内抓取的主干道。在這里加 nofollow,蜘蛛能到的地方會明顯缩水。除非某個入口指向的是完全不希望被抓的内容,否則不要動。

登入、註冊、帮助、隐私條款

這些頁面通常不需要參與排名,用 nofollow 處理是可以的,但要確認它們不是別的頁面的唯一入口。如果帮助中心里藏着有搜尋價值的說明文档,整块加 nofollow 會把文档一起挡在外面。

被 nofollow 的連結,蜘蛛仍然可能發現

這点常被忽略。蜘蛛發現 URL 的途径不止一條:外部連結、Sitemap、其他頁面的普通連結,甚至用戶提交。一條 nofollow 連結只是让蜘蛛少了一條路径,不等于把這個 URL 從互联網上抹掉。反過来讲,如果某個 URL 你确實不想被抓,光加 nofollow 是不够的。

判断标准很简單:你是想让蜘蛛別跟這條連結,還是想让這個頁面別被抓?前者用 nofollow,後者用 robots.txt 或 noindex,两者不要混着用。

加之前先問三個問题

  • 屏蔽這條連結後,目标頁面還有没有別的入口?如果没有,就是切断了路径。
  • 這個頁面是真的没有價值,還是只是暂时不想让它參與排名?前者可以 nofollow,後者考虑 noindex。
  • 是整块加還是逐條加?整块加容易誤伤,逐條加更可控。

路径完整比單点設定更重要

蜘蛛進站之後靠連結一步步走。一條 nofollow 本身不致命,致命的是几條叠在一起,让某個栏目從入口到正文之間出現断层。所以做完設定後,最好自己從首頁点進去,看能不能只用普通連結走到每一個重要頁面。走得通,說明路径没問题;走不通,那條路對蜘蛛多半也断了。

定期回头看一遍

nofollow 最容易出問题的地方不是加错,而是加了之後没人再检查。改版、換模板、上新栏目时,舊規則可能還在生效。建议每隔一段時間從模板层搜一遍 nofollow,看看哪些還在用、是否仍然合理。同时對照服務器日誌,留意那些長期没有蜘蛛訪問的頁面,它們很可能就是被某條 nofollow 或死鏈挡在了外面。