搜尋抓取

面包屑、導航與正文内鏈:蜘蛛進站後走的路是谁铺的

蜘蛛進站时没有路线图,只能顺着連結走。主導航、面包屑、正文内鏈和頁脚連結块的作用各不相同,位置與數量都會影响 URL 發現的效率。本文說明這几類連結块的分工、常见的内鏈坑,並给出一份可以直接照着做一遍的自查清單。

搜尋抓取

面包屑、導航與正文内鏈:蜘蛛進站後走的路是谁铺的

蜘蛛進站之後,手里没有你画的路线图,它能依靠的只有連結。站点地图可以告诉它站点里有哪些 URL,但真正决定它先看什么、走到多深的,是頁面上那些可点击的連結。連結摆在哪儿,蜘蛛的路就铺到哪儿。

連結的位置比數量更重要

同一批連結,放在導航里和放在頁脚,蜘蛛给出的待遇並不一样。位置越靠近頁面主体、越稳定、數量越克制,越容易被反复走到。

主導航

主導航是全站最容易被抓取的連結块,几乎每個頁面都有,蜘蛛從任何一個入口進来都能顺着它走一遍。所以它适合放栏目的核心頁,不适合塞進几十個二級、三級入口。導航一旦膨胀,每個連結分到的關注就被摊薄。

面包屑

面包屑的作用是把层級關系说清楚:首頁 → 分類 → 子類 → 詳情。蜘蛛顺着它能確認自己處在站点的哪一层,也能從詳情頁快速退回分類頁,减少爬到一半就停住的情况。面包屑里的連結建议用正常的 a 标簽,不要做成纯样式文字。

正文内鏈

正文里自然出現的連結,往往是權重传递最有效的一類。它带着上下文,指向的頁面和目前内容相關。比起在文章末尾堆一長串“相關阅讀”,正文里三五個真正相關的連結,對 URL 發現的帮助通常更實在。

頁脚和侧栏

頁脚适合放少量全站通用的頁面,比如關于我們、联系方式、站点地图。它的風險是容易變成連結仓库:几十上百條連結铺满整块,蜘蛛每次来都要重新走一遍,真正需要被發現的新頁面反而排在後面。

几個常见的内鏈坑

  • 導航用 JavaScript 生成。如果導航是渲染後才出現的,蜘蛛在某些情况下可能拿不到這些連結,站内路径就等于断了一截。
  • 重要頁面只從一個入口進入。只挂在某篇舊文章里的新頁面,發現速度完全取决于那篇文章被抓取的频率。
  • 連結文字全是“点击這里”。蜘蛛並不直接靠锚文本排名,但清楚的锚文本能帮你判断自己铺的路是否符合预期,也是自查内鏈的好线索。
  • 分頁、篩選、排序連結混進導航。這類 URL 會快速膨胀,把可抓取的連結位挤占掉。

自查时可以這样做

  1. 随手打開一個中間层頁面,看首頁到它之間有没有一條三步以内的連結路径。
  2. 關掉 JavaScript 再打開頁面,检查導航和面包屑里的連結還在不在。
  3. 數一數頁脚和侧栏的連結總數,把不承担 URL 發現任務的連結清掉。
  4. 看日誌里被抓取最多的頁面清單,確認這些頁面是不是你真正希望蜘蛛花時間的地方。
内鏈的目标不是让蜘蛛看到所有頁面,而是让重要的頁面有一條稳定、少绕路、能被反复走到的路径。

把連結位置理清楚之後,再去看站点地图、抓取预算這些话题會轻松很多:地图负责說明有哪些 URL,内鏈负责让蜘蛛愿意並且能够走過去,两者配合,URL 發現才有稳定的节奏。