站点的 URL 被发现,多数时候不是靠 Sitemap 一条条读过去,而是蜘蛛顺着链接一层层走。从首页出发,点到某个详情页需要几次跳转,这个次数就是常说的点击深度。它不直接决定收录,但会影响蜘蛛多久能碰到这个 URL,以及之后多久回来一次。
点击深度是怎么算的
首页算第 0 层。首页上直接链出去的页面是第 1 层,第 1 层页面再链出去的算第 2 层,依此类推。同一个 URL 可能有多个入口,取最短的那条路径作为它的深度。
需要注意的是,这里算的是可被蜘蛛跟随的普通链接。JS 渲染后才出现的链接、需要点击按钮才展开的内容、表单提交后跳转的页面,都要另算。对这类路径,蜘蛛往往要排队渲染才能拿到。
深度增加时,蜘蛛多付出什么
每多一层,蜘蛛就要多抓一个中间页面,多解析一份 HTML,多占一点抓取时间。层数深了以后,三个变化比较常见:
- URL 被首次发现的时间往后推,新页面可能要等更久才进入抓取队列。
- 同一批抓取时间里,深页被重新访问的间隔变长,改版和更新的反馈更慢。
- 如果中间某一层的页面本身抓得不频繁,它下游的链接就更难被及时走到。
实际影响因站而异。栏目更新快、内链密的站点,五六层也能被稳定抓到;结构松散、中间层是低频页面的站点,三四层以外就可能掉队。
怎么检查自己的深度分布
不用复杂工具也能大致判断:
- 从首页手动点几下,记录到几个核心页面各需要几步。
- 看服务器日志里这些 URL 的抓取频率,和首页、栏目页对比。
- 用站内搜索或爬虫工具跑一遍,导出每个 URL 的最短路径长度分布。
- 重点看深度最大的那批 URL 里,有没有本该重要的页面。
如果发现大部分详情页都在第 5 层以上,而第 2、3 层净是些无关紧要的列表,那就说明内链的权重分配和页面的重要程度没对上。
把重要页面往前挪的几种做法
- 减少中间层:能合并的列表页合并,避免“首页 → 大类 → 子类 → 二级子类 → 列表 → 详情”这种长链。
- 加横向入口:在首页或高频栏目页放热门、最新的直达链接,给重要页面一条短路径。
- 相关推荐要用真实链接:详情页之间的推荐如果只是按钮或 JS 跳转,对蜘蛛等于没有。
- 分页别切太碎:列表页翻到很后面才出现的条目,深度会被动增加,可以让常用筛选项走独立入口。
把链接堆在页脚,或者做一个“全部页面”的目录页,看起来能压平深度,但这些链接在同一页大量重复出现时,蜘蛛对它们的判断会变弱,效果不一定比自然内链好。
深度不是唯一变量
深度只是内链结构的一个侧面。链接所处的位置、周围内容的相关性、页面自身的更新频率,都会一起影响蜘蛛的访问节奏。与其追求所有页面都在三层以内,不如确认一件事:你希望被优先抓到的页面,是否有一条短而稳定的链接路径通到它。把这条路径理顺,比单纯减少层数更有意义。