很多站長看抓取日誌时會發現一個現象:首頁、栏目頁被反复抓取,真正带内容的詳情頁却十天半月才来一次。原因通常不是蜘蛛懒,而是這些頁面對它来说太遠了——從入口走到它,要经過好几层点击。
点击深度與抓取深度不是一回事
点击深度是從站点入口到某個頁面的最短点击次數,由内鏈结构决定,基本是你自己能控的。抓取深度是蜘蛛實际抓取时形成的层級分布,受抓取预算、連結權重、頁面更新频率共同影响。两者相關但不相等:点击深度浅的頁面更容易被優先抓,点击深度深的頁面往往要等前面几层抓完才轮到。
蜘蛛為什么容易在浅层堆积
- 首頁和栏目頁連結數量最多,蜘蛛一進来就被大量 URL 分流,每條連結分到的關注度很低。
- 新出現的連結通常優先入队,老頁面、深层頁面排在後面。
- 列表分頁一层套一层,第三十頁之後的連結往往几個月不被触碰。
- 靠脚本渲染出来的連結,第一次抓取时可能根本不存在,等于断了路。
结果就是:浅层頁面被反复抓,深层頁面長期排队。
先確認自己的站点有多深
不用猜,從两處看即可。一是抓取日誌,把被抓 URL 按路径层級归類,統計各层被抓次數;二是内鏈结构,随手挑几個詳情頁,看從首頁出發最少几次点击能到。如果大部分正文頁需要四跳以上,說明层級偏深,蜘蛛的抓取會明顯偏向前几层。
压缩点击深度的常用做法
- 把重要入口放在栏目頁首屏,而不是全站頁脚。頁脚塞太多連結,等于每條都不重要。
- 用聚合頁或专题頁做中轉,把散落的詳情頁收拢到一两個頁面下。注意聚合頁本身要有實质内容,別做成纯連結堆。
- 分頁给出明确的可抓連結。無限滚動和“点击加载更多”最好配一個普通連結版本,否則後面的内容蜘蛛很难自己翻到。
- 面包屑和上下級互鏈让深层頁面有回程,也让蜘蛛從詳情頁反向發現同层内容。
- Sitemap 直接给深頁入口,把它当作补路手段,而不是唯一手段。
深頁不是塞進 Sitemap 就完事
Sitemap 能告诉蜘蛛這些 URL 存在,但不保證優先抓、優先收。如果這些頁面在其他地方没有任何内鏈指向,抓取频率往往很低,更新也很难被及时看到。更常见的做法是:Sitemap 提供入口,内鏈提供路径,两者配合。
判断一個深层頁面是否值得被抓,可以問自己:如果我是蜘蛛,除了 Sitemap,還有哪條路能走進来?答不上来,就得补連結。
几個容易踩的坑
- 把几萬條連結一股脑塞進首頁,看似缩短了深度,實际分散了權重,效果常常更差。
- 用篩選和排序參數生成大量深层 URL,让蜘蛛在無價值组合里打轉。
- 层級中間塞了一堆没有内容的空壳中轉頁,蜘蛛進去之後無事可做。
- 只顾加連結,忘了让重要頁面保持更新,蜘蛛来過一次發現没變化,下次就不急着来。
抓取深度是個结构問题,改版时顺手梳理一次内鏈层級,比事後到處补連結有效得多。先让重要頁面离入口近一点,再谈抓取频次和预算,顺序才不會反。