網站收錄

從首頁点几下才能到:頁面深度對 URL 發現的影响

頁面深度指從首頁经過几次連結跳轉能到達目标頁,它不直接决定收錄,却會影响 URL 被發現的速度和後續抓取频率。本文区分点击深度與 URL 层級,列出容易變成"事實上的深頁面"的類型,並给出一套從入口排查到内鏈补位的自查顺序。

網站收錄

從首頁点几下才能到:頁面深度對 URL 發現的影响

很多站点排查收錄时,會先盯站点地图、提交接口和 robots 規則,但真正影响一個新 URL 早不早被發現的,往往是它在站内的位置:從首頁点几下能到。頁面深度(常说的点击深度)指的是從首頁出發,经過多少次連結跳轉能到達目标頁。這個數字不直接决定收錄,却會影响發現速度,以及被發現之後被再次抓取的机會。

点击深度和 URL 层級不是一回事

這两個概念经常被混在一起,但它們描述的是不同的東西。

  • URL 层級:/news/2024/03/title 這样的目錄层數,多數时候只是命名习惯或程序结构,和搜尋引擎能多快找到它没有直接關系。
  • 点击深度:從首頁出發,沿真實存在的連結一路点過去需要几步。這才是爬虫判断"這個頁面在站内處于什么位置"的參考。
  • 一個 URL 层級很深的頁面,如果首頁或栏目頁有直達連結,点击深度可能只有两层;反過来,一個短 URL 如果只出現在某個深层列表里,實际深度可能很夸張。

深度太深,最先受影响的是發現

爬虫不會無限往下钻。站点越大、頁面越多,單個 URL 能分到的抓取机會越有限,越靠近首頁、被更多頁面連結到的 URL,越容易在較早的抓取轮次里被訪問到。深度大的頁面通常會出現几種情况:發現時間被拉長;進入索引後重抓間隔變長,内容更新了但索引版本迟迟不換;内鏈传递的權重被稀释,頁面在同類内容里不占優势。

需要說明的是,這些都只是概率上的倾向,不是"深度超過 N 层就不會被收錄"的硬規則。结构清晰的小站,即使四五层也未必有問题;頁面量級很大的站,两三层以外就開始明顯吃力。

哪些頁面容易變成"事實上的深頁面"

  • 分頁很深的列表:第 20 頁之後的内容,可能只有"下一頁"這一條鏈子牵着。
  • 篩選、排序、價格区間等參數頁:入口藏在交互控件後面,不点開就没有連結。
  • 按年月归档和标簽頁:归档入口常放在頁脚,或者只在文章頁底部出現一次。
  • 只在"相關文章"模块露面的老内容:模块本身還常常是随机或按热度轮換。
  • 需要登入、需要在站内搜尋才能找到的頁面:外部爬虫基本看不到這條路径。

一套可执行的自查顺序

  1. 挑 10 到 20 個有代表性、希望被收錄的頁面,记錄它們的地址。
  2. 從首頁開始,只用站内連結手動找過去,數一數需要几步。找不到入口的,先记下来。
  3. 在站点地图、栏目頁、专题頁里反查這些 URL:它們各自被哪些頁面鏈到,連結出現在頁面什么位置。
  4. 對只在頁脚、只在"更多"按钮後面、只在随机模块里出現的入口,考虑移到栏目首屏或固定模块。
  5. 给重要但孤立的内容补一條稳定的内鏈,比如在對應的分類頁或上下文中加一條自然提及,而不是堆一串"相關推荐"。
  6. 改完之後不要只看当天日誌,隔几周回头看這些 URL 的抓取频率和索引狀態。

扁平化也要有度

知道深度有影响之後,另一個极端是把全站連結塞進首頁或頁脚。這種做法會让頁面充满與主题無關的連結,既稀释了重要入口的權重,也给抓取带来大量低價值目标。把首頁、導航和頁脚当成"分配入口"的工具,只放真正需要更快被發現的栏目和节点,比無差別铺開更有效。

深度是相對的:中小站点做到首頁、栏目、内容三层以内,通常已经够用;内容量大的站点,需要靠分類、标簽、专题和相關模块把入口补回来,而不是指望站点地图解决一切。

收錄是结果,很难單獨優化。把頁面深度控制在合理范围,让重要内容有稳定、可追溯的内鏈入口,通常比反复提交 URL 更實际,也更经得起後續的结构調整。