很多站长盯着“收录了多少”,却很少问一句:蜘蛛是从哪里走到这个页面的,走了几层?抓取深度这个说法不常被提起,却直接影响一个 URL 被发现的概率和被抓取的频率。层级越深,蜘蛛要跨过的中间节点越多,任何一环出问题,后面的页面就断了线索。
蜘蛛眼里的“深度”是什么
蜘蛛不读你的目录结构,它手里只有一张从种子 URL 出发的图。深度指的是从已知入口(通常是首页、Sitemap 或外部链接)到目标页面,需要经过多少次链接跳转,也就是点击距离。
点击距离,不等于目录层级
URL 写成 /a/b/c/d/page.html 并不代表它很深,如果首页直接有一条链接指向它,它就是第一层。反过来,一个 /page.html 如果只能从某篇文章的正文链接过去,那它的点击距离至少是两层。
深度只是影响抓取的一个变量
蜘蛛的抓取预算有限,它要在有限次数里决定先看谁。同一批待抓 URL 中,路径短、被站内多处引用的页面通常更容易排到前面。深度不是唯一因素,但它是排队的筹码之一。
深层内容为什么容易被落下
- 列表页只展示最新一屏,老内容要翻很多页才出现,翻页链接本身也可能被限制抓取。
- 筛选、排序、多参数组合生成的 URL 一层套一层,蜘蛛走进去以后拿到的还是列表。
- 内容只能靠站内搜索框到达,而搜索结果是动态页,蜘蛛基本走不进去。
- 关键入口页一旦返回错误或被屏蔽,整条链路下面的页面全部失去发现路径。
把重要内容往浅处挪
给核心页面留直达入口
首页、栏目首屏、导航、面包屑,这些位置能直接连到的页面,点击距离最短。与其纠结 URL 长短,不如先检查核心页面在站内被多少条链接指向。
用聚合页做中转
聚合页、专题页、标签页能把散落的深层内容收拢到一个较浅的节点上。前提是聚合页本身能被稳定抓取,并且确实指向具体内容,而不是只通向另一个列表。
Sitemap 作为平行入口
Sitemap 相当于给蜘蛛提供一条绕开层层跳转的直路。把重要 URL 放在主 Sitemap 里,别只留在分片深处;lastmod 保持真实,不要整批一起改。
相关推荐与双向链接
文章底部的相关阅读、正文中的自然引用,都能缩短老页面与新内容之间的距离。这类链接不必多,但要稳定存在,不要依赖脚本延迟渲染。
别为了浅而堆链接
把全站链接塞进页脚、每篇文章挂几十条推荐,看似把深度压到一层,实际上稀释了每条链接的信号,蜘蛛也更容易把页面当成导航页而不是内容页。链接的价值在于指向明确,而不是数量。
判断一条内链是否有效,可以问一句:如果删掉它,蜘蛛还能不能从别的地方找到目标页面?如果答案是能,这条链接的必要性就值得重新考虑。
怎么检查自己的深度问题
- 从首页出发,按站内链接模拟一条路径,记录到核心页面需要几步。
- 看服务器日志,统计蜘蛛访问的 URL 分布,深层路径占多大比例。
- 检查分页、筛选、搜索结果页是否占用了大量抓取次数,却没有带回新的内容页。
- 对长期没被抓的重要页面,补一条来自浅层页面的直达链接,观察后续访问变化。
抓取深度不能解决所有问题,但它解释了很多“内容明明有价值却不被看见”的情况。让重要的 URL 离入口近一点,等于把发现的成本降下来。至于能抓到多少、抓得多快,还要看服务器响应、页面体积和整体抓取节奏是否配合得上。