做收錄自查时,常會遇到一種情况:首頁和主要栏目頁收錄正常,越往里的頁面越难被抓到。不少人把它归因于權重不够,但更直接的原因往往在结构上。蜘蛛要先發現 URL,才谈得上抓取和收錄,而發現的主要途径就是沿着連結一层层走下去。
点击深度说的是什么
点击深度指從首頁出發,最少点几次連結能到達某個頁面。首頁算第 0 层,導航直接指向的栏目是第 1 层,栏目列表里的文章是第 2 层,文章正文里再鏈出去的頁面就是第 3 层。它不是搜尋引擎公開的排名指标,但和抓取調度關系很近:层數越深,通向它的連結路径越少,進入抓取队列的机會也越靠後。
這個说法容易被理解成硬阈值,比如“超過三层就不收”。實际並不是這样。深度只是概率因素,一個深處頁面如果被多個高频更新的頁面稳定鏈着,照样能被規律抓取;反過来,一個浅层頁面如果入口頁本身几個月没人訪問,也可能長期停着。
蜘蛛顺着連結走,但不會無限走
常規抓取以連結為线索。栏目頁更新频繁、被訪問次數多,從它出發的連結就容易進入下一轮抓取。而一個只有零星入口、外层頁面自身也很久没被抓的 URL,可能長時間停在“已發現、未抓取”的狀態。
另一個容易被忽略的点是路径數量。同一個頁面如果有三五條不同层級的入口,被抓到的概率會明顯高于只有一條入口的頁面。所以判断一個 URL 难不难收,不只看它有多深,還要看它有几個入口、這些入口本身是否活跃。
哪些做法會人為加深深度
- 文章只進分頁很深的歷史列表,第一頁之後几乎不给内頁入口;
- 導航或“加载更多”靠 JS 渲染,連結不出現在初始 HTML 里;
- 重要内容只能通過站内搜尋结果頁或篩選參數頁到達;
- 相關推荐模块随机抽取,某些頁面長期没被鏈到;
- 栏目改版後舊入口撤掉,新入口只挂在一個很少更新的頁面上。
這些做法的共同点是:頁面本身没問题,但從首頁到它的路径被拉長或切断了。排查时先用结构视角看一遍,往往比反复改正文更有效。
自查可以按這個顺序做
- 挑 5 到 10 個想收錄但没收錄的 URL,從首頁出發手動找最短点击路径,记下實际层數和入口數量。
- 结合服務器日誌或抓取记錄,看這些 URL 最近一次被抓是什么时候,是否稳定出現過。
- 检查這些入口頁自身的更新频率和被抓情况,入口頁不活跃,連結它的價值也就有限。
- 找同類型、已正常收錄的頁面做對照,比較深度和入口數量的差別。
- 差別明顯时,優先在常更新的栏目頁、上下篇導航、固定推荐位里加入口,而不是在全站到處撒連結。
調整时容易踩的坑
- 内鏈不是越多越好,位置和上下文比數量更重要,堆在頁脚的連結價值有限;
- 不要為了缩短深度,把大量内容硬塞進首頁,這會让首頁連結過于分散;
- 改完不必马上判断效果,先观察日誌里抓取频次是否變化,再决定下一步;
- 栏目结构改動影响面大,可以分批調整,避免一次性把原有入口全撤掉。
内鏈和层級解决的只是“能不能被發現”。頁面是否收錄,還要看内容质量、是否與已有頁面重复、能否正常渲染。把结构問题清理干净,只是让後面的判断少一层干扰。
把点击深度当成一個可测量的结构指标来對待,比笼统地说“權重不够”更容易找到可执行的動作。多數情况下,先在几個活跃栏目里补上稳定入口,观察两三周日誌變化,就能看出頁面是否開始被規律抓取。