搜尋抓取

導航、面包屑、正文内鏈:三條路径怎么把蜘蛛送到深层頁

蜘蛛進站後主要靠連結扩散,但導航、面包屑和正文内鏈承担的角色並不相同。本文拆解三類連結模块各自能触達的范围、容易被稀释的地方,以及怎么配合使用,让深层頁面在抓取路径里更容易被走到。

搜尋抓取

導航、面包屑、正文内鏈:三條路径怎么把蜘蛛送到深层頁

蜘蛛進入一個站点後,除了 Sitemap 和外部連結,绝大多數新 URL 是顺着頁面上的連結一层层走下去的。站内連結模块看起来很多,但真正承担“带路”职责的主要是三類:全局導航、面包屑和正文内鏈。它們出現的位置不同,能触達的頁面范围也不同。如果混在一起看,很容易得出“内鏈已经做得很全”的错觉,實际却發現某些深层頁几個月都没有被走到。

全局導航:覆盖面最广,信息量最薄

導航通常出現在每個頁面的同一位置,因此它是站内被重复次數最多的連結模块。好處是稳定:只要頁面被抓到,導航里的連結就一定會被讀到,深层頁也就多了一次被發現的机會。

問题在于,導航的容量有限。為了不让首屏變乱,很多站点會把導航压缩成若干個一級栏目,最多再挂几個二級入口。结果就是導航能覆盖到的 URL 层次偏浅,再往下的詳情頁、标簽頁、歷史归档頁,導航基本不參與。

另一個常见情况是導航里的連結指向的都是聚合頁,聚合頁本身内容稀薄,連結又少,蜘蛛走到這里就停住了。導航负责“铺面”,但不负责“往下钻”。

面包屑:给深层頁补一條可回退的路

面包屑的價值常被低估。它出現在每個詳情頁上,天然连接了“目前頁—上級分類—更上級分類—首頁”這條鏈路。對蜘蛛来说,這意味着任何一個被抓到的深层頁,都會把連結權重新送回它的上級分類頁,让分類頁有更多机會被重新抓取,從而繼續發現新的詳情頁。

需要注意的是,面包屑的每一級最好都是真實可訪問的連結,而不是纯文本。有些站点只把最後一級做成連結,前面几級用文字占位,這就等于把回退路径砍掉了一半,蜘蛛只能停在目前頁。

另外,面包屑的层級不要為了好看而人為拉長。如果中間某級指向的是一個没有實际内容的占位頁,蜘蛛走進去只會浪費一次抓取,對 URL 發現没有帮助。

正文内鏈:最容易被低估的發現通道

正文里的連結往往是發現新 URL 最有效的一類,因為它带着上下文。蜘蛛在判断一個連結是否值得跟進时,锚文本和周围文字是重要的參考。導航里寫“更多”,正文里寫“某型号电池的更換步骤”,後者顯然指向更明确。

實际运营中,正文内鏈常见的两個极端:一是完全不加,文章寫完就發,新頁面只能等 Sitemap 或導航被重抓时才被發現;二是加得太随意,同一段里塞進五六個連結,锚文本全是“点击這里”,讀起来磕绊,蜘蛛也拿不到有效信息。

更合理的做法是让正文内鏈承担“從老頁到新頁”的任務。新内容上线後,回到几篇主题相關、已经有稳定抓取记錄的舊文里,补一條自然的内鏈。這條路径比等 Sitemap 重新被抓要直接得多。

三類連結怎么配合

  • 導航负责站点主干,保證一級、二級栏目都能被稳定抓到,不追求覆盖全部 URL。
  • 面包屑负责纵向连通,让每一個詳情頁都能回到分類,避免出現只有入口没有出口的断头路。
  • 正文内鏈负责横向和新舊连接,把新上线的 URL 挂到已经活跃的頁面上。

判断這三條路径是否走通,不用靠猜。直接在站内從首頁出發,只用鼠标点击,看看能不能在三四次点击内到達你希望被發現的頁面。如果连人工都要靠搜尋框才能找到,蜘蛛走到的概率也不會高。

几個常被問到的問题

把連結全放進導航行不行

不行。導航能挂的連結數量受布局限制,全站几千個 URL 塞進去,既影响用戶体驗,也會让每個連結分到的關注被摊薄。導航适合放结构,不适合放清單。

面包屑要不要展示全部层級

按目錄结构展示即可,不必把每個中間頁都列出来。重点是每一級都真實可点,而不是层級堆得完整却断鏈。

正文内鏈加多少算合适

没有固定數字,判断标准是這條連結對讀者有没有用。如果删掉它,讀者會找不到相關信息,那它就值得留;如果只是為了堆數量,删掉反而更好。

連結不是越多越好,而是越连贯越好。蜘蛛能顺着一條清晰的路從入口走到深层頁,比在几十個入口之間反复横跳更有意义。