很多站点會遇到這種情况:新頁面提交了站点地图,内鏈也加了,但蜘蛛迟迟不来,或者来了只抓一次。排查时大家习惯先看 robots、canonical、狀態碼,這些确實優先。但如果這些都正常,下一步值得看的是連結路径——從首頁出發,要点几次才能到目标頁。
点击深度是什么
点击深度指從站点入口頁(通常是首頁)出發,沿着可点击連結走到某個 URL 所需的最少跳數。首頁是第 1 层,導航栏里的分類是第 2 层,分類下的列表頁是第 3 层,列表頁里的詳情頁是第 4 层,以此類推。
對爬虫来说,站内連結是發現新 URL 的主要途径之一。站点地图能提供一份名單,但它不保證抓取顺序和频次;真正影响“多久被找到一次”的,往往是頁面在連結網絡里的位置。
深度為什么會影响抓取與收錄
先说清楚一件事:抓取和收錄是两件事。爬虫抓到了頁面,只能說明它讀過;是否進入索引,還要看頁面质量、重复度、内容是否可渲染等。点击深度主要影响前一步——蜘蛛能不能找到、會不會反复回訪。
- 發現概率:深在第五、第六层的頁面,從首頁出發的路径可能只有一两條,任何一條断掉,整段頁面就變成孤岛。
- 回訪频次:靠近入口、被多個頁面連結的 URL,更容易被反复抓取;埋得很深的頁面,更新後可能要很久才被重新讀取。
- 路径脆弱:如果唯一的入口是分頁最後一頁的推荐位,或者一個不定期更換的运营位,路径随时會消失。
這里不必把深度当成硬指标。三层和四层没有本质差別,真正的問题是路径少且不稳定,而不是數字本身。
自查:哪些頁面被埋得太深
- 從首頁開始手動点一遍,记錄到重点頁面需要几次点击。
- 看蜘蛛日誌里的抓取路径:如果某個目錄的 URL 几乎只靠站点地图触發,說明站内連結贡献很少。
- 检查是否有頁面只有一條入鏈,而且這條鏈来自低质量或低频頁面。
- 看面包屑、相關推荐、标簽聚合這些模块是否真的輸出了可抓取的連結,而不是 JS 点击事件。
常见的越点越深结构
- 詳情頁只從列表頁進入,而列表頁只有第一頁被連結,後面的分頁靠加载更多按钮。
- 多級篩選參數把 URL 层层叠加,每個组合都變成一個可訪問地址。
- 内容只在站内搜尋里能找到,没有固定入口。
- 归档、标簽、作者頁大量複製同一批連結,把路径绕遠。
把重要路径收短
- 确定核心层級:先分清哪些頁面需要被搜到,哪些只是辅助。重要頁面尽量控制在從首頁三到四次点击内。
- 补固定入口:導航、面包屑、相關推荐、专题頁都可以作為稳定入口,優先用服務端渲染輸出的普通連結。
- 分頁给可抓的連結:不要把所有後續頁都藏在加载更多里,至少保證存在可点击的分頁地址。
- 减少無意义层級:中間层如果只是空白分類頁,可以考虑合並或直接連結到下一层。
- 用站点地图兜底:把重要 URL 放進去,但它解决的是知道有這個地址,不等于優先抓取。
点击深度不是排名的直接因素,它影响的是發現速度和路径稳定性。把深頁從只有一條路改成有几條稳定的路,比單纯追求层級數字更實际。
做完之後怎么驗證
調整連結结构後,別急着看收錄量。先看蜘蛛日誌里這些 URL 的抓取次數、首次抓取時間、狀態碼有没有變化,再看索引覆盖报告里的分類是否從已發現、已抓取未编入等狀態轉入已编入。這個過程通常需要几周,不同站点差异很大。
如果路径已经收短、抓取也正常,但頁面還是進不了索引,問题就不在深度上,需要回到頁面质量、重复内容和渲染结果去排查。