很多站点會遇到這样的情况:首頁和栏目頁都被收錄了,但某些詳情頁長期停留在「已發現」狀態,或者干脆没有動静。排查 sitemap、robots、canonical 都正常,這时候可以換一個角度——從首頁出發,要点几次連結才能到那個頁面。
点击深度是什么,為什么會牵扯到抓取
点击深度指的是從站点入口出發,沿着站内連結到達某個頁面最少需要经過几次跳轉。通常首頁算第 0 层,主導航里的一級栏目是第 1 层,栏目下的列表頁是第 2 层,列表頁里的詳情頁是第 3 层,以此類推。
搜尋引擎每天在站内能走的路径和次數都有上限。层級越深的頁面,被發現的路径越少,能分到的抓取机會也越少。這不代表深层頁面一定不會被收錄,但确實會让發現和重新抓取變得更慢。
還有一個容易忽略的点:同样在第 3 层的頁面,如果只有一條入口,和有三四條来自不同位置的入口,被訪問的概率是不同的。入口數量和质量往往比單纯的层級數字更關键。
深度太深时常见的表現
- sitemap 里提交了,日誌里偶尔能看到抓取,但索引狀態長期没有變化。
- 只有少數几個入口指向该頁面,連結還都藏在 JS 折叠菜單或很深的分頁里。
- 同一批上线的頁面,浅层的很快有動静,深层的迟迟不動。
- 頁面之間互鏈只靠「相關推荐」這類動態模块,静態 HTML 里看不到連結。
排查顺序
- 先數路径:從首頁開始,只用 HTML 里真實存在的 a 标簽,手動点出一條到目标頁的最短路径,记下跳轉次數。
- 再確認連結是否可被抓取:連結是不是由 JS 渲染後才出現,是不是用了 onclick 或按钮而非 a 标簽,是不是需要登入或提交表單才能進入。
- 看内鏈數量:除了列表頁,有没有其他頁面自然提到並連結到它,比如相關文章、专题頁、面包屑。
- 看抓取日誌:確認爬虫是否訪問過该 URL,訪問频率與同层級其他頁面相比是否明顯偏低。
- 看列表頁分頁:如果詳情頁只出現在第 5 頁之後,而分頁連結又不是可抓取的 a 标簽,實际可發現性會更差。
可以做的調整
思路是让重要頁面拥有更多、更浅的入口,而不是靠堆砌連結。
- 把重要栏目或聚合頁放進主導航,减少一級入口的跳轉次數。
- 列表頁控制每頁條數,避免新品或新文章被挤到很深的頁碼。
- 用面包屑、标簽聚合、专题頁给詳情頁增加静態入口,連結文字自然描述目标内容。
- 确保關键連結在服務端渲染或首屏就存在,而不是等 JS 执行後才插入。
- 定期用站点地图對照内鏈,找出「只有 sitemap 提到、站内没有任何入口」的頁面。
几個容易走偏的地方
增加入口不等于到處塞連結。同一個锚文本在大量頁面重复指向同一地址,容易被判断為刻意堆砌;把不相關的頁面硬鏈在一起,對用戶也没有價值。更稳妥的做法是围绕内容本身组织内鏈,让連結出現的位置符合用戶的阅讀路径。
也不必為了压低层級把所有頁面都塞進導航。導航過载會稀释每個入口的權重,反而让真正重要的頁面不突出。分清楚哪些是核心頁面、哪些可以留在深层通過搜尋或专题頁触達,效果通常更好。
点击深度只是排查收錄的一個维度。sitemap 质量、頁面内容、服務器响應、URL 規范同样會影响结果,任何單一手段都不能保證收錄。
小结
当常規項都排查過、收錄仍然卡住时,不妨從首頁手動走一遍到目标頁的路径,看看它到底藏在第几层、有几個真實入口。多數情况下,先解决「爬虫能不能顺畅發現」的問题,比反复提交 URL 更有意义。