網站收錄

点击深度:從首頁到頁面要点几次,才算没被埋住

点击深度指從首頁出發沿可跟随連結到達某頁面所需的最少点击次數。它不直接决定收錄,但明顯影响頁面被發現的快慢和重爬频率。本文讲清深度的定义、用工具测量三項關键資料的方法、几個常见誤区(JS 導航、只靠 sitemap、無限滚動),以及通過分頁、相關阅讀和全站導航把重要頁面压到 3~4 次点击以内的實用做法。

網站收錄

点击深度:從首頁到頁面要点几次,才算没被埋住

很多人排查收錄問题时,习惯從内容质量和 sitemap 入手,却忽略了一個更基础的東西:蜘蛛要花多少步才能從首頁走到這個頁面。這個步數就是点击深度(click depth),也有人叫爬取深度。它不决定頁面能不能被收錄,但會明顯影响“多久被發現”“多久被重爬一次”。

点击深度指的是什么

從站点入口頁(通常是首頁)出發,沿着可点击的連結到達目标頁面所需的最少点击次數,就是点击深度。注意几個限定:

  • 只算 HTML 里可以跟随的連結,JS 点击事件、需要交互才出現的連結不算;
  • 算的是最少步數,不是唯一路径;
  • 入口不止首頁,sitemap、栏目頁、站内搜尋也能算入口,但常規口径仍以首頁為主。

所以首頁直達是深度 1,首頁 → 栏目 → 詳情是深度 2,再往下每加一层列表,深度就加 1。

為什么深度會牵扯到收錄

蜘蛛每次来站的抓取量是有限的,它會按一定预算分配請求。深度越大的頁面,越容易被排在後面;预算用完,就只能等下一次。结果就是:浅层頁面几小时、几天就有變化,深层頁面可能要等几周,甚至長期停在“已發現,尚未抓取”。

另外,深度往往和内鏈數量、被引用次數绑在一起。深层頁面通常内鏈少、外部連結也少,等于既难被發現,也难被判断為重要。两件事叠在一起,就表現為“内容不差,就是不收錄”。

怎么量自己站点的点击深度

不需要很复杂的工具,用爬虫類工具跑一遍就能看到每個 URL 的 Depth 字段,也可以自己從首頁做几次广度優先的跳轉记錄。看三個數就够:

  1. 站点最大深度是多少,主要收錄頁面一般建议控制在 3~4 次点击以内;
  2. 有多少 URL 深度大于 4,這些是重点观察對象;
  3. 有多少 URL 只能通過 sitemap 找到,站内没有任何連結指向(孤岛頁面,本质上深度無限)。
深度不是越浅越好。把所有頁面都塞進首頁,會稀释首頁的連結價值,也會让用戶和蜘蛛都找不到重点。關键是让重要頁面浅,让不重要頁面能被發現但不抢资源。

几個常见誤区

  • 只加 sitemap,不改内鏈。sitemap 是入口之一,能帮助發現,但不构成内鏈關系;只靠 sitemap 的頁面,重爬频率通常明顯偏低。
  • 用 JS 渲染的導航。如果栏目導航依赖 JS 生成,蜘蛛可能看不到這條路径,實际深度比你自己点出来的更深。
  • 無限滚動加“加载更多”。滚動加载的内容對爬虫不一定是可跟随連結,分頁連結保持在 HTML 里更稳妥。
  • 把目錄层級当成点击深度。URL 里的 /a/b/c/ 和点击几次完全不是一回事,目錄深不等于点击深,反之亦然。

把深度压下来的几種做法

  • 栏目列表頁做合理分頁,並给舊内容保留可達路径,而不是只展示最近 20 條。
  • 加相關阅讀、热门内容、上下篇等模块,让詳情頁互相连接,给深层頁面更多入鏈。
  • 用标簽頁、聚合頁做横向连接,但要控制數量,避免生成大量低质列表頁。
  • 重要板块稳定放在全站導航或首頁,別随活動频繁變動位置。
  • 定期复查孤岛頁面:要么给它内鏈,要么承認它不重要。

什么时候可以不用管深度

如果站点頁面量很小(几百以内),或者内容更新频率本来就低,深度带来的差异不會太明顯,優先級可以往後放。相反,頁面量上萬、更新频繁的站点,深度是抓取效率里最值得先調的一項。

最後提醒:点击深度是“發現與重爬”的優化項,不是收錄開關。頁面能不能進索引,最终還是回到内容本身、重复度、URL 規范這些老問题。把深度理顺,只是让蜘蛛更省力地走到你希望它看到的頁面。