讨论收录时,人们常把注意力放在站点地图、提交接口和 robots.txt 上,却很少回头看一件事:从首页出发,一个页面需要点几次才能到达。这个“点击深度”不是收录的硬性门槛,但它会实实在在地影响爬虫发现 URL 的顺序和频率。
点击深度到底在量什么
点击深度指的是从首页开始,沿着站内链接走到某个页面所需的最少跳转次数。首页是一级,首页直接链出去的页面是二级,以此类推。这里要注意两点:一是“最少”——只要存在一条短路径,就算数;二是“站内链接”——导航、正文里的超链接、列表页都算,纯靠搜索框或表单提交才能到达的路径不算。
测量时最好用站点爬虫工具跑一遍,它会把每个 URL 的层级和入口来源一起列出来。手工估算容易漏掉隐藏在推荐位、页脚或侧栏里的短路径。
深度为什么会牵动发现与抓取
爬虫每次来访的抓取额度是有限的,它大致按照“首页 → 一级栏目 → 更深层”的顺序往外扩散。深度越大,页面被访问到的轮次往往越靠后,页面发生变化后被抓取到的间隔也可能更长。这不等于深页面一定不收,而是它的发现成本更高、信号更容易被稀释。
- 链接层级越深,指向该页的内链数量通常越少;
- 内链少的页面,更新后不容易被重新访问;
- 导航结构频繁调整时,深页面更容易被“漏掉”。
换个角度说,浅层页面天然拥有更多入口和更快的复访节奏,深页面则要依赖别的手段补上这一块。
几种把页面做深的常见做法
- 只靠搜索框:商品页、帮助文章只能通过站内搜索进入,页面上没有可爬取的静态链接。
- 压在分页末端:列表页翻到第五页之后才有入口,爬虫很少走到那么深。
- 纯前端渲染的列表:链接由脚本插入,抓取时拿不到 href。
- 栏目层层套娃:大分类下再分小分类,最终页面落在第四、第五层。
可以做的调整
给重要页面一条短路径
把当前最需要被发现的页面,在首页或一级栏目里给出固定入口。热门、最新、推荐位都是合适的载体,但位置要相对稳定,不要每次刷新都换一批,否则链接等于没建。
用交叉内链增加入口
相关内容、上下一篇、专题聚合,都能给深页面多开几条通道。判断标准很简单:从任意一个页面出发,能否在两三次点击内回到目标页。
站点地图兜底,但别当主路径
站点地图能帮助发现 URL,但它不传递权重,也不能替代内链的作用。把站点地图当作补给线,内链才是主干道。
一个可执行的检查流程
- 挑出十到二十个业务上最重要的页面;
- 用站点爬虫工具跑一遍,记录它们的最小点击深度;
- 把深度大于三层的页面单独列出来;
- 给这些页面补 1 到 2 条来自浅层页面的内链;
- 隔一段时间再看,确认深度和抓取情况都有变化。
点击深度影响的是发现效率,不是收录结果本身。把它当成一条优化线索,而不是一道开关。
收录是多因素共同作用的结果,内链深度只是其中一环。但它有个好处:可量化、可调整,而且改完之后你能在前端结构上直接看到变化。对大多数中小站点来说,先把重要页面的路径理顺,比反复提交站点地图更实在。