很多站点排查收录时,会先盯站点地图、提交接口和 robots 规则,但真正影响一个新 URL 早不早被发现的,往往是它在站内的位置:从首页点几下能到。页面深度(常说的点击深度)指的是从首页出发,经过多少次链接跳转能到达目标页。这个数字不直接决定收录,却会影响发现速度,以及被发现之后被再次抓取的机会。
点击深度和 URL 层级不是一回事
这两个概念经常被混在一起,但它们描述的是不同的东西。
- URL 层级:/news/2024/03/title 这样的目录层数,多数时候只是命名习惯或程序结构,和搜索引擎能多快找到它没有直接关系。
- 点击深度:从首页出发,沿真实存在的链接一路点过去需要几步。这才是爬虫判断"这个页面在站内处于什么位置"的参考。
- 一个 URL 层级很深的页面,如果首页或栏目页有直达链接,点击深度可能只有两层;反过来,一个短 URL 如果只出现在某个深层列表里,实际深度可能很夸张。
深度太深,最先受影响的是发现
爬虫不会无限往下钻。站点越大、页面越多,单个 URL 能分到的抓取机会越有限,越靠近首页、被更多页面链接到的 URL,越容易在较早的抓取轮次里被访问到。深度大的页面通常会出现几种情况:发现时间被拉长;进入索引后重抓间隔变长,内容更新了但索引版本迟迟不换;内链传递的权重被稀释,页面在同类内容里不占优势。
需要说明的是,这些都只是概率上的倾向,不是"深度超过 N 层就不会被收录"的硬规则。结构清晰的小站,即使四五层也未必有问题;页面量级很大的站,两三层以外就开始明显吃力。
哪些页面容易变成"事实上的深页面"
- 分页很深的列表:第 20 页之后的内容,可能只有"下一页"这一条链子牵着。
- 筛选、排序、价格区间等参数页:入口藏在交互控件后面,不点开就没有链接。
- 按年月归档和标签页:归档入口常放在页脚,或者只在文章页底部出现一次。
- 只在"相关文章"模块露面的老内容:模块本身还常常是随机或按热度轮换。
- 需要登录、需要在站内搜索才能找到的页面:外部爬虫基本看不到这条路径。
一套可执行的自查顺序
- 挑 10 到 20 个有代表性、希望被收录的页面,记录它们的地址。
- 从首页开始,只用站内链接手动找过去,数一数需要几步。找不到入口的,先记下来。
- 在站点地图、栏目页、专题页里反查这些 URL:它们各自被哪些页面链到,链接出现在页面什么位置。
- 对只在页脚、只在"更多"按钮后面、只在随机模块里出现的入口,考虑移到栏目首屏或固定模块。
- 给重要但孤立的内容补一条稳定的内链,比如在对应的分类页或上下文中加一条自然提及,而不是堆一串"相关推荐"。
- 改完之后不要只看当天日志,隔几周回头看这些 URL 的抓取频率和索引状态。
扁平化也要有度
知道深度有影响之后,另一个极端是把全站链接塞进首页或页脚。这种做法会让页面充满与主题无关的链接,既稀释了重要入口的权重,也给抓取带来大量低价值目标。把首页、导航和页脚当成"分配入口"的工具,只放真正需要更快被发现的栏目和节点,比无差别铺开更有效。
深度是相对的:中小站点做到首页、栏目、内容三层以内,通常已经够用;内容量大的站点,需要靠分类、标签、专题和相关模块把入口补回来,而不是指望站点地图解决一切。
收录是结果,很难单独优化。把页面深度控制在合理范围,让重要内容有稳定、可追溯的内链入口,通常比反复提交 URL 更实际,也更经得起后续的结构调整。