網站收錄

頁面离首頁有多遠:点击距离與目錄深度對收錄的影响

很多站長把收錄問题归结為目錄太深,但真正影响蜘蛛到達效率的往往是点击距离。本文区分目錄深度與点击距离,說明遠距离頁面容易被漏抓的原因,给出缩短路径的几種做法,並介绍如何用日誌驗證蜘蛛的真實行走路线。

網站收錄

頁面离首頁有多遠:点击距离與目錄深度對收錄的影响

排查收錄問题时,很多人第一反應是看 URL 的目錄层級:/a/b/c/d/page.html 這種寫法是不是太深了?层級确實值得關注,但它本身很少是决定性因素。更接近蜘蛛真實体驗的指标,是從首頁出發要点几次連結才能到達這個頁面,也就是常说的点击距离(click depth)。

点击距离和目錄深度不是一回事

目錄深度只是 URL 字面上的斜杠數量,而点击距离描述的是站内連結图上的跳數。两者经常不一致:

  • 一個頁面路径寫着 /news/2024/03/18/xxx.html,但只要在首頁的最新文章列表里出現,点击距离就是 1。
  • 另一個頁面路径短得只有 /p/123,但如果它只被一個很少有人訪問的归档頁連結到,点击距离可能是 4 甚至 5。

蜘蛛是按連結走的,不是按路径讀的。所以当你對比两個頁面的抓取频次差异时,先看的應该是它們各自被哪些頁面鏈到、這些頁面本身又在什么位置,而不是路径長短。

為什么距离遠的頁面容易被漏掉

蜘蛛在一次訪問里能走的步數是有限的,它會優先沿着連結密集、更新频繁、响應稳定的路径展開。距离首頁越遠,中途断鏈、跳轉、參數分叉的机會越多,蜘蛛走到那里的概率就越低。常见情况包括:

  • 列表頁只展示前几頁,老頁面沉到第 10 頁以後,没有任何入口鏈到它。
  • 導航和面包屑只覆盖到二級分類,三級以下的頁面全靠站内搜尋才能找到。
  • 某個中間层頁面本身收錄狀態就差,導致它下游的整片頁面都缺少有效入口。

這種情况下,即使頁面内容质量没問题,也可能長期停留在“已被發現但未抓取”的狀態。

缩短点击距离的几種做法

不必為了短路径去大規模改 URL,改结构往往得不偿失,更實际的是补入口:

  1. 让重要頁面出現在固定入口上。首頁、栏目首頁、侧邊推荐位這些位置蜘蛛訪問最频繁,把需要收錄的頁面放進去,效果通常好于在 sitemap 里反复提交。
  2. 给深层頁面补一條向上的路径。面包屑、相關推荐、标簽聚合頁都可以承担這個角色,前提是它們本身能被正常抓取。
  3. 检查中間层是否健康。如果分類頁本身没被索引,先解决分類頁的問题,下游頁面才有通道。
  4. 避免用纯 JS 渲染導航。需要执行脚本才能展開的菜單,蜘蛛不一定會走完。
  5. sitemap 可以作為补充入口,但不要当成唯一入口。它能帮助蜘蛛發現 URL,却很难改變一個頁面在站内的實际位置。

用日誌驗證真實的行走路线

判断点击距离是否真的构成障碍,比較直接的办法是看服務器日誌:

  • 統計被訪問最多的路径,通常就是蜘蛛的主干路线。
  • 筛出那些只被訪問過一两次的 URL,观察它們是從哪個 referer 進来的、是否位于主干之外。
  • 對比同類頁面的抓取間隔,如果同一层級的頁面抓取频次差出好几倍,差异往往来自入口位置而不是内容本身。

日誌看不出的话,也可以在 Search Console 的抓取統計里观察目錄维度的分布,再回到站内找對應的連結入口。

哪些情况不用太纠结距离

点击距离不是越短越好,也不是所有頁面都值得往首頁塞。工具頁、篩選结果頁、用戶中心這類頁面,本来就不该進索引,與其想办法缩短路径,不如用 robots.txt 或 noindex 明确處理。真正需要關注的,是那些有搜尋需求、内容獨立、但目前藏在深處的頁面。

把入口理顺,比反复提交 URL 更有效。蜘蛛走的是連結,不是你的期待。

換句话说,收錄問题的排查顺序可以先從“這個頁面有没有一條稳定的站内路径”開始,再去看抓取预算、渲染方式這些因素。路径通畅了,後面的环节才有讨论的意义。