很多站点的问题不是没有内容,而是关键页面被放在了一条很长的发现链条末端。首页到详情页要经过五六层,中间还夹着筛选和分页,搜索蜘蛛即使能沿着链接走进来,也未必有足够的抓取配额走到最深处。抓取深度,本质上决定了 URL 被发现的机会大小。
一、抓取深度为什么会影响 URL 发现
搜索蜘蛛的来访是有预算的。它从一个入口进入站点,沿着链接一层层展开,每往下一层,消耗的抓取次数就更多。深度越浅的页面,被反复回访的机会越多;深度越深的页面,往往要等前面的页面抓得差不多了,才可能排进队列。
这带来一个常见现象:首页、栏目页几乎天天被访问,而真正有内容的详情页,半个月才被看一眼。并不是详情页不重要,而是它距离入口太远,路径太长。
二、层级是怎么被算出来的
最短路径优先
同一个 URL 通常会被记成离入口最近的那条路径的距离。也就是说,只要你能在某处给它安排一条更短的入口,它的层级就会随之改善。
多条链路并不等于多次机会
一个页面被十条链接指向,并不会让它的层级变浅,但会增加它被重新发现的概率。真正决定能不能入队的,还是最短的那条路径。
三、几种常见的越点越深的结构
- 栏目页只放一个更多按钮,真实列表藏在第二层页面里;
- 列表页依赖脚本渲染,链接在源码里不存在,只能靠站点地图兜底;
- 详情页之间互不引用,每个页面都是孤立的终点;
- 归档、标签、作者页层层嵌套,把入口价值稀释掉;
- 导航只写一级分类,二级分类只能靠面包屑返回。
这些结构单独看都不算错,叠在一起就会让详情页的可达深度成倍增加。
四、把重要 URL 拉近入口的几个动作
- 在首页或一级栏目页保留一组稳定的人工入口,指向当前最重要的内容分类。
- 正文里用相关阅读、上下篇、同标签推荐,把同一层的页面横向连起来。
- 列表页尽量在 HTML 中输出真实链接,减少对脚本的依赖。
- 给深层页面补一批来自浅层页面的直链,哪怕数量不多。
- 控制归档页、筛选页的自动生成规模,避免浅层位置被低价值 URL 占满。
五、深度不是越浅越好
把所有页面都塞进首页,结果是首页的链接价值被摊薄,重要页面反而得不到足够关注。更合理的做法是分级:核心页面保持在两跳以内,长尾内容允许深一些,但要有稳定的横向链路维持。
另一个容易被忽略的点是路径稳定性。如果每次更新都改动导航结构,蜘蛛上一次记住的路径就可能失效,需要重新探索一遍,发现效率会明显下降。
六、怎么核对真实深度
把抓取日志和站内链接表放在一起看,可以反推每个 URL 最近一次是被哪个页面带进来的,以及从入口算起经过了几跳。重点看两类页面:有内容但长期没有抓取记录的,和抓取频繁但页面价值很低的。
- 有内容无抓取:优先补浅层直链,而不是反复提交;
- 抓取多价值低:收敛生成规则,减少浅层噪声;
- 层级忽深忽浅:检查导航和列表模板近期有没有改动。
抓取深度很难一次调好。它更像一条随内容增长不断变化的路,需要定期看看关键的 URL 是不是还留在入口附近。