点击深度指的是什么
從首頁出發,顺着連結往下走,到某個頁面需要点几次,這個次數就是点击深度。首頁算第 0 层,主導航指向的栏目頁是第 1 层,栏目下的列表頁是第 2 层,文章詳情頁常见落在第 3 层。层級越深,蜘蛛要经過的連結就越多,中間任何一环没被爬到,後面的頁面就跟着一起卡住。
深度為什么會拖慢抓取
蜘蛛在站内的時間是有限的,它會把大部分精力放在靠近入口、被連結多次指向的頁面上。深度带来的影响主要有三個:
- 路径變長:每多一层,就要多经過一次請求。中間某個列表頁抓取频率下降,深层頁面跟着受影响。
- 連結權重被稀释:同一份入口權重经過多层传递後,到達深层頁面的分量會明顯變少,蜘蛛回訪的频率也更低。
- 發現時間推後:新發布的頁面如果只挂在深层列表里,往往要等上一轮列表被抓取之後才會被带出来。
這些不是绝對的規則,但方向大体一致:路径短的頁面,被稳定抓取的概率更高一些。
几種把頁面越埋越深的结构
层层嵌套的分類目錄
地区 → 城市 → 区县 → 商圈 → 品類 → 子品類,每一层都做成獨立連結,看着清晰,實际把詳情頁推到了第七、第八层。蜘蛛能走到底,但走到底的次數遠不如前几层。
只靠篩選和參數生成列表
很多列表頁的翻頁或篩選结果由參數拼接而成,這類 URL 數量可以不断增長,蜘蛛容易在參數组合里打轉,反而顾不上真正的詳情頁。
内容都堆在首頁或少數聚合頁
另一種相反的情况是:所有入口都挤在首頁,首頁連結上百個,每個連結分到的關注度被摊薄,深层頁面依然得不到稳定的抓取。
把深度压下来的常见做法
- 控制主路径层數:常規内容尽量在三次点击内到達,能合並的中間层就合並。
- 用好導航和面包屑:這两類連結位置固定、全站可见,是蜘蛛判断站点结构的主要依據。
- 在正文里做相關連結:詳情頁之間互相指向,等于给深层頁面补了一條横向通道。
- 用 Sitemap 兜底:深层頁面單獨列進站点地图,至少让蜘蛛知道 URL 存在,不必完全依赖逐层爬取。
- 给出可抓取的入口:分頁、分類、聚合頁尽量用普通連結,避免只在点击时才生成。
怎么確認自己站点的深度
最简單的办法是定时抓取自己的站点,记錄每個 URL 到首頁的最短点击距离,把超過四层的頁面列出来,看看它們是否有稳定的抓取记錄。也可以對照服務器日誌,看深层目錄下的 URL 多久被訪問一次,如果長時間只有零星几次,說明路径确實太長了。改结构时不必一次全改,先從那些有内容、但抓取一直很淡的頁面入手,把入口往前挪一层,观察一段時間再说。
深度不是唯一的决定因素,但它是一個可以自己動手調整的變量。多數情况下,让重要頁面离首頁更近一步,比反复提交 URL 更實在。