有些站点内容並不差,問题出在“够不着”。蜘蛛從首頁出發顺着連結一层层走,如果某個栏目要翻三次列表才露面,或者一篇文章只有站内搜尋才能找到,那么它被發現的概率就會明顯下降。点击深度就是衡量這件事的一個简單指标:從首頁到目标頁面,最少需要点几次。
点击深度量的是什么
点击深度通常指從首頁出發,沿站内連結到達某個頁面所需的最少点击次數。首頁算第 0 层,主導航直接指向的栏目是第 1 层,栏目列表里的文章是第 2 层,再往里就要繼續翻列表或走内鏈。
它和 URL 里的目錄层級不是一回事。一個頁面可以是 /a/b/c/d/ 這样看着很深的路径,但只要首頁上就有直達連結,它的点击深度仍然是 1;反過来,一個 URL 干干净净的頁面,如果只能從第五頁列表点進去,實际深度就是 5。
為什么值得單獨查一遍
点击深度偏大带来的影响,通常是叠加出現的:
- 發現成本變高。蜘蛛需要走過更多中間頁才能触達深层内容,中間任何一环没被有效抓取,後面的頁面就跟着被挡在外面。
- 抓取预算被摊薄。分頁列表、归档頁、篩選頁本身也需要抓,深度越大,花在“路上”的請求就越多。
- 用戶路径同样變長。人找不到的内容,連結自然少,頁面在站内的位置會越来越邊缘。
需要說明的是,深度大不等于頁面没價值。很多網站的舊文章、長尾内容本来就在深层,關键在于它是否只有深這一條路可走。
自查:三種把深度量准的办法
用爬虫工具跑一遍
把首頁作為起点,限制只跟随站内連結,導出每個頁面的“层級”或“点击深度”字段,按數值從大到小排序。先看两端:深度超過 4 到 5 的頁面里,有多少是你真正希望被訪問的;再随机抽十几個,回到浏览器里手動点一遍,確認工具给出的路径是真實存在的。工具跑出来的深度是静態連結的深度,如果有大量連結靠脚本注入,结果會和實际情况有偏差,這点要留意。
從服務器日誌反推
日誌里不會直接寫深度,但能反映结果。挑一批只在深层出現的 URL,看它們在一個月内被蜘蛛請求過几次。如果長期為零,而站点地图里确實提交過這些地址,基本可以判断是入口太窄,而不是地址本身有問题。同时看看 referer,能大致還原蜘蛛是從哪個頁面走進来的。
人工抽查冷门頁面
從後台内容列表里按發布時間或訪問量排序,抽 20 篇左右,试着不用搜尋框、只靠導航和列表找到它們,记錄需要几次点击。這一步費时,但能發現工具测不出的問题,比如某些入口只在特定设备上顯示。
常见的“埋深”场景
- 内容只在分頁列表的第三頁之後出現,且没有更靠前的入口。
- 只有标簽聚合頁能通到,而标簽頁本身又没進導航。
- 依赖站内搜尋结果頁作為唯一入口,蜘蛛一般不提交搜尋词,等于進不去。
- 改版或栏目調整後,舊内容被挪進归档目錄,但新導航里没有對應入口。
- 栏目頁本身存在,却没有出現在任何導航或頁脚里,只能靠站点地图發現。
調整时的几個動作
- 把重要栏目放回主導航。一級入口是控制深度的最直接手段,別把導航当成装饰。
- 做相關性内鏈。文章之間按主题互相指向,比在正文里堆一堆無關連結有效,也更自然。
- 控制列表分頁的深度。與其让用戶和蜘蛛一直往後翻,不如按時間或主题切分出更清晰的子列表。
- 用站点地图兜底。它不能替代連結,但可以作為深层頁面的补充入口,前提是里面提交的地址确實可訪問、可索引。
- 减少没内容的過渡頁。只起跳轉作用的中間层越多,深度就越容易被無意义地拉長。
点击深度是參考指标,不是越浅越好。首頁如果塞進上百個連結,反而會让每個入口都變弱。合理的目标是:重要的内容在两三次点击内可達,長尾内容有稳定的入口,不必强求全部贴到首屏。
建议把這項检查放進固定周期里,比如每個季度或每次改版之後重跑一次。结构變動往往在不经意間把一批頁面的深度推高,早發現比事後补内鏈省力得多。