很多人排查收錄問题时,习惯從内容质量和 sitemap 入手,却忽略了一個更基础的東西:蜘蛛要花多少步才能從首頁走到這個頁面。這個步數就是点击深度(click depth),也有人叫爬取深度。它不决定頁面能不能被收錄,但會明顯影响“多久被發現”“多久被重爬一次”。
点击深度指的是什么
從站点入口頁(通常是首頁)出發,沿着可点击的連結到達目标頁面所需的最少点击次數,就是点击深度。注意几個限定:
- 只算 HTML 里可以跟随的連結,JS 点击事件、需要交互才出現的連結不算;
- 算的是最少步數,不是唯一路径;
- 入口不止首頁,sitemap、栏目頁、站内搜尋也能算入口,但常規口径仍以首頁為主。
所以首頁直達是深度 1,首頁 → 栏目 → 詳情是深度 2,再往下每加一层列表,深度就加 1。
為什么深度會牵扯到收錄
蜘蛛每次来站的抓取量是有限的,它會按一定预算分配請求。深度越大的頁面,越容易被排在後面;预算用完,就只能等下一次。结果就是:浅层頁面几小时、几天就有變化,深层頁面可能要等几周,甚至長期停在“已發現,尚未抓取”。
另外,深度往往和内鏈數量、被引用次數绑在一起。深层頁面通常内鏈少、外部連結也少,等于既难被發現,也难被判断為重要。两件事叠在一起,就表現為“内容不差,就是不收錄”。
怎么量自己站点的点击深度
不需要很复杂的工具,用爬虫類工具跑一遍就能看到每個 URL 的 Depth 字段,也可以自己從首頁做几次广度優先的跳轉记錄。看三個數就够:
- 站点最大深度是多少,主要收錄頁面一般建议控制在 3~4 次点击以内;
- 有多少 URL 深度大于 4,這些是重点观察對象;
- 有多少 URL 只能通過 sitemap 找到,站内没有任何連結指向(孤岛頁面,本质上深度無限)。
深度不是越浅越好。把所有頁面都塞進首頁,會稀释首頁的連結價值,也會让用戶和蜘蛛都找不到重点。關键是让重要頁面浅,让不重要頁面能被發現但不抢资源。
几個常见誤区
- 只加 sitemap,不改内鏈。sitemap 是入口之一,能帮助發現,但不构成内鏈關系;只靠 sitemap 的頁面,重爬频率通常明顯偏低。
- 用 JS 渲染的導航。如果栏目導航依赖 JS 生成,蜘蛛可能看不到這條路径,實际深度比你自己点出来的更深。
- 無限滚動加“加载更多”。滚動加载的内容對爬虫不一定是可跟随連結,分頁連結保持在 HTML 里更稳妥。
- 把目錄层級当成点击深度。URL 里的 /a/b/c/ 和点击几次完全不是一回事,目錄深不等于点击深,反之亦然。
把深度压下来的几種做法
- 栏目列表頁做合理分頁,並给舊内容保留可達路径,而不是只展示最近 20 條。
- 加相關阅讀、热门内容、上下篇等模块,让詳情頁互相连接,给深层頁面更多入鏈。
- 用标簽頁、聚合頁做横向连接,但要控制數量,避免生成大量低质列表頁。
- 重要板块稳定放在全站導航或首頁,別随活動频繁變動位置。
- 定期复查孤岛頁面:要么给它内鏈,要么承認它不重要。
什么时候可以不用管深度
如果站点頁面量很小(几百以内),或者内容更新频率本来就低,深度带来的差异不會太明顯,優先級可以往後放。相反,頁面量上萬、更新频繁的站点,深度是抓取效率里最值得先調的一項。
最後提醒:点击深度是“發現與重爬”的優化項,不是收錄開關。頁面能不能進索引,最终還是回到内容本身、重复度、URL 規范這些老問题。把深度理顺,只是让蜘蛛更省力地走到你希望它看到的頁面。