蜘蛛從首頁出發,沿着連結一层层走到詳情頁。這個過程中经過的层級數,通常被称為抓取深度。它不只是一個结构問题,更直接影响新頁面被發現的快慢,以及蜘蛛把時間花在哪些地址上。
抓取深度到底指什么
日常沟通里,抓取深度经常混着三個概念,先分開看會更清楚。
- 点击深度:從首頁出發,点几次連結能到達目标頁。三次以内通常算浅,五次以上就偏深。
- 目錄层級:URL 路径的层級,比如 /a/b/c/d/。它和点击深度有關,但不是一回事,URL 深不代表一定要点很多次。
- 連結深度:蜘蛛實际沿着内鏈爬行时经過的跳數。同一頁面可能有多個入口,最短的那條路径更重要。
對抓取来说,最值得關注的是最短路径。如果詳情頁只能從某個深层列表頁進入,而首頁没有更短的通道,蜘蛛到達它的频率就會低很多。
层級過深會带来什么
层級本身不是問题,問题在于蜘蛛的抓取時間和請求量都有限。路径太深时,常见的情况有几類。
- 新頁面迟迟不被發現,或者被發現後很久才再次回訪。
- 列表頁和中間頁占據了大量抓取量,詳情頁拿到的份額變少。
- 部分頁面只有一條很深的入口,一旦中間頁改版或失效,就變成孤岛。
- 分頁、篩選參數层层叠加,蜘蛛在同一個栏目里反复打轉。
這些現象不一定會立刻表現在收錄數字上,但會在日誌里留下痕迹:抓取集中在少數入口,深层頁面回訪間隔明顯拉長。
把层級压到合理范围
不需要把所有頁面都做成扁平结构,那样反而會让首頁連結過多、權重分散。更實际的做法是让重要内容有一條短路径,同时保留清晰的分類。
首頁和栏目頁的入口
首頁适合放最核心的栏目和少量重点内容。栏目頁承担主要的聚合作用,把该分類下最值得抓取的頁面直接鏈出去。如果某個栏目下内容很多,考虑在栏目頁增加热门、最新或精選区块,让深层頁面获得更短的入口。
列表頁與分頁的衔接
列表頁是詳情頁最常见的入口。分頁不要只依赖加载更多按钮,至少保留可点击的翻頁連結。翻頁數量很多时,可以按時間或热度做归档入口,避免蜘蛛為了到達早期内容翻過几十頁。
面包屑和上下文連結
面包屑能给蜘蛛一條回到上层的路径,也能让用戶看清位置。文章正文里的相關阅讀、上一篇下一篇,同样可以给深层頁面增加入口。數量不用多,關键是連結指向真實相關的内容,而不是随机堆砌。
几個容易忽略的细节
- 導航里用 JavaScript 绑定点击、没有 href 的連結,蜘蛛通常走不通,尽量保留标准連結。
- 對整站導航或列表頁滥用 nofollow,可能把詳情頁的入口一起挡掉。
- 篩選和排序參數生成大量 URL,會让蜘蛛在低價值頁面上消耗抓取量,需要收敛。
- 站点地图能补充發現渠道,但不能替代内鏈。一個没有内鏈入口的頁面,即使寫進 Sitemap,抓取優先級也往往偏低。
怎么检查自己站点的抓取深度
- 從日誌里抽取蜘蛛訪問的 URL,按目錄和路径归组,看抓取量集中在哪一层。
- 用抓取工具模拟從首頁出發的爬行,记錄每個頁面被到達的最少跳數。
- 對照 Sitemap 和日誌,找出只出現在 Sitemap、却很少被内鏈到達的地址。
- 抽查詳情頁,確認是否存在獨立入口、面包屑和列表頁入口。
抓取深度没有统一标准。對内容型站点,三到四次点击内到達詳情頁通常比較從容;對商品或文章量很大的站点,更重要的是让重要頁面拥有多條短路径,而不是强行压缩层級。
把入口设計清楚,蜘蛛走的路就越接近你希望它走的路。與其反复提交地址,不如先检查首頁到詳情頁之間,是否有一條稳定、简短、可以持續维護的連結通道。