搜索抓取

抓取深度与链接层级:URL 离首页几跳还能被搜索蜘蛛发现

抓取深度决定了 URL 被发现的机会大小。本文梳理层级是如何计算的、哪些常见站内结构会把详情页越推越深,以及把核心 URL 拉回浅层的具体做法,并给出用抓取日志核对真实深度的思路。

搜索抓取

抓取深度与链接层级:URL 离首页几跳还能被搜索蜘蛛发现

很多站点的问题不是没有内容,而是关键页面被放在了一条很长的发现链条末端。首页到详情页要经过五六层,中间还夹着筛选和分页,搜索蜘蛛即使能沿着链接走进来,也未必有足够的抓取配额走到最深处。抓取深度,本质上决定了 URL 被发现的机会大小。

一、抓取深度为什么会影响 URL 发现

搜索蜘蛛的来访是有预算的。它从一个入口进入站点,沿着链接一层层展开,每往下一层,消耗的抓取次数就更多。深度越浅的页面,被反复回访的机会越多;深度越深的页面,往往要等前面的页面抓得差不多了,才可能排进队列。

这带来一个常见现象:首页、栏目页几乎天天被访问,而真正有内容的详情页,半个月才被看一眼。并不是详情页不重要,而是它距离入口太远,路径太长。

二、层级是怎么被算出来的

最短路径优先

同一个 URL 通常会被记成离入口最近的那条路径的距离。也就是说,只要你能在某处给它安排一条更短的入口,它的层级就会随之改善。

多条链路并不等于多次机会

一个页面被十条链接指向,并不会让它的层级变浅,但会增加它被重新发现的概率。真正决定能不能入队的,还是最短的那条路径。

三、几种常见的越点越深的结构

  • 栏目页只放一个更多按钮,真实列表藏在第二层页面里;
  • 列表页依赖脚本渲染,链接在源码里不存在,只能靠站点地图兜底;
  • 详情页之间互不引用,每个页面都是孤立的终点;
  • 归档、标签、作者页层层嵌套,把入口价值稀释掉;
  • 导航只写一级分类,二级分类只能靠面包屑返回。

这些结构单独看都不算错,叠在一起就会让详情页的可达深度成倍增加。

四、把重要 URL 拉近入口的几个动作

  1. 在首页或一级栏目页保留一组稳定的人工入口,指向当前最重要的内容分类。
  2. 正文里用相关阅读、上下篇、同标签推荐,把同一层的页面横向连起来。
  3. 列表页尽量在 HTML 中输出真实链接,减少对脚本的依赖。
  4. 给深层页面补一批来自浅层页面的直链,哪怕数量不多。
  5. 控制归档页、筛选页的自动生成规模,避免浅层位置被低价值 URL 占满。

五、深度不是越浅越好

把所有页面都塞进首页,结果是首页的链接价值被摊薄,重要页面反而得不到足够关注。更合理的做法是分级:核心页面保持在两跳以内,长尾内容允许深一些,但要有稳定的横向链路维持。

另一个容易被忽略的点是路径稳定性。如果每次更新都改动导航结构,蜘蛛上一次记住的路径就可能失效,需要重新探索一遍,发现效率会明显下降。

六、怎么核对真实深度

把抓取日志和站内链接表放在一起看,可以反推每个 URL 最近一次是被哪个页面带进来的,以及从入口算起经过了几跳。重点看两类页面:有内容但长期没有抓取记录的,和抓取频繁但页面价值很低的。

  • 有内容无抓取:优先补浅层直链,而不是反复提交;
  • 抓取多价值低:收敛生成规则,减少浅层噪声;
  • 层级忽深忽浅:检查导航和列表模板近期有没有改动。

抓取深度很难一次调好。它更像一条随内容增长不断变化的路,需要定期看看关键的 URL 是不是还留在入口附近。