很多站長在排查收錄慢的时候,第一反應是内容不够好,或者蜘蛛来得太少。但還有一個常被忽略的因素:頁面离首頁有多遠。從首頁出發,顺着一层层連結点到某個頁面需要点几次,這個次數就是它的連結深度,也叫点击距离。
点击距离是怎么算的
首頁算第 1 层,直接挂在首頁導航下的栏目頁是第 2 层,栏目頁里的文章是第 3 层。如果再往下有子分類、标簽頁、归档頁,深度就會繼續累加。常见的站点结构里,大多數内容頁落在第 3 到第 5 层之間,超過 5 层才能点到的頁面就要留意了。
這里的层數是按最短路径算的,不是按目錄层級算。URL 里寫了几級目錄,和点击距离是两件事。一個形如 /a/b/c/d/page.html 的地址,如果首頁某個区块直接鏈過去,它的点击距离就只有 1。
為什么深一点就可能拖慢收錄
搜尋引擎的爬虫從首頁開始,顺着連結一层层扩散。深度带来的影响主要体現在三個方面:
- 發現顺序:浅层頁面几乎每轮抓取都會被走到,深层頁面要等前面几层都爬完才有机會被碰到。
- 抓取配額:站点每天能被抓取的頁面數量是有限的,配額通常優先分给首頁附近、更新频繁、内鏈多的頁面。
- 重訪频率:浅层頁面可能几天就重抓一次,深层頁面可能几周才轮到一次,内容更新後重新被评估的机會自然更少。
需要說明的是,深度本身不是惩罚。搜尋引擎並没有超過几层就不收錄的規則,現代爬虫也不會因為深度大就放弃一個頁面。真正起作用的是:深层頁面被發現得更晚,能分到的抓取次數更少,于是它在索引里更新得更慢。
深度不是單獨起作用
同样是第 5 层,一個頁面有一堆相關文章鏈過来,另一個只有父級栏目鏈過去,结果可能完全不同。判断时要一起看:有多少内鏈指向它、這些連結出現在哪些頁面、锚文本能不能說明頁面主题、頁面本身有没有可索引的價值。深度只是其中一個變量,不是决定因素。
自查:先看深度分布和日誌
- 用爬虫工具跑一遍站点,看各個层級的頁面數量和占比,找出最深的几批 URL。
- 翻服務器日誌,統計深层目錄的抓取频次,和浅层目錄做對比。
- 在站長工具里看已發現但尚未编入索引的 URL 分布,是否集中在某几個目錄。
如果某批 URL 深度很大、日誌里几乎没有抓取记錄,那問题大概率出在结构上,而不是内容质量。
几種把頁面變浅的做法
增加中間层入口
把内容量大、更新频繁的分類做成专题頁或聚合頁,作為中間枢纽,让原本要 5 次点击才能到的頁面缩到 3 次。枢纽頁本身要有實际内容,不能只是标题列表的堆砌。
用好面包屑和相關推荐
面包屑能让深层頁面多一條回到上級和首頁的路径;文章底部的相關推荐則能横向连接同主题頁面,让蜘蛛從一個頁面走到另一個頁面,而不是每次都退回首頁重新走一遍。
站点地图当补充,不当主力
sitemap 可以帮助發現一些缺少内鏈的頁面,但它不解决頁面太深的問题,也不保證抓取顺序。真正的通道還是站内連結。
扁平化的邊界
把所有連結都堆到首頁,會让首頁連結過于分散,每個頁面分到的權重更少,用戶也找不到重点。合理的做法是:首頁和主導航放最重要的栏目和常青内容,其余頁面通過分類頁、专题頁、相關推荐逐步下放。层級存在是正常的,只要不是必须绕好几圈才能点到。
一個简單的判断顺序
- 先確認頁面本身值得收錄:有獨立内容,不是重复頁或空壳頁。
- 再看它從首頁出發需要几次点击,超過 4 到 5 次的重点頁面,考虑补一條更短的路径。
- 然後看它有多少内鏈、锚文本是否合理。
- 最後對比日誌里的抓取频次,判断是结构問题還是抓取配額問题。
連結深度不會單獨决定收錄,但它决定了頁面多快被看到、多久被重訪一次。把重要頁面的路径缩短,通常是结构調整里性價比比較高的一步。