抓取深度到底在说什么
抓取深度指的是:从首页或者某个入口页出发,蜘蛛要沿着链接走几跳,才能碰到目标 URL。它衡量的是路径长度,而不是页面质量。同一个页面,放在导航里是 1 跳,藏在三级分类的第 8 页列表里可能是 6 跳,蜘蛛对它的发现速度和回访频率会明显不同。
需要先说清楚:抓取深度不是排名因素,站点也不该为了“压深度”把所有页面都塞进首页。它更像一个工程问题——蜘蛛每次抓取的页面总量是有边界的,路径越长的 URL,越容易在某一层被截断。
蜘蛛的访问是有边界的
蜘蛛会按自己的节奏分配抓取量:先走近期更新频繁、外链较多、历史表现稳定的路径,再逐步扩散到更深的层级。站点规模越大,这个分配越明显。一个几万 URL 的站点,如果重要内容都在 5 跳之外,蜘蛛很可能长期只覆盖到浅层,深层页面只能靠 Sitemap 偶尔被翻到。
多数中小站点把重要页面控制在 3 跳以内比较稳妥;超过 5 跳的 URL,通常需要靠 Sitemap 或外部链接来补位,而不是指望站内自然扩散。
三类常见的深度陷阱
1. 层层套娃的分类结构
比如“首页 → 大类 → 子类 → 二级子类 → 地区 → 列表 → 详情”,每一层都只有一个入口,蜘蛛走到第四层就可能不再往下。判断方法很简单:在站内用当前路径数一数,从首页点到目标页要点几次链接。如果超过 4 次,就值得考虑合并层级或者给深层内容加横向入口。
2. 只靠分页串联的列表
有些站点把内容全部塞进一条长长的分页链,第 1 页指向第 2 页,第 2 页指向第 3 页。这种线性结构会让越靠后的内容越难被碰到。可以做的就是让分页链接保持可抓取的 a 标签形式,同时给列表加排序、聚合或者索引页,让后段内容有别的入口。
3. 孤岛页面
只在 Sitemap 里出现、站内没有任何链接指向的页面,是最典型的孤岛。蜘蛛能不能抓到,基本取决于它愿不愿意专门去读 Sitemap 里的那一条。对这类页面,最直接的做法是在相关文章、专题页或者归档页里补上至少一条站内链接。
把深层 URL 拉近的几种做法
- 面包屑导航:给每个详情页提供一条回到上级和首页的路径,既方便用户,也让蜘蛛知道层级关系。注意用可抓取的链接,而不是纯前端状态切换。
- 相关阅读与热门推荐:在正文底部放置同主题链接,相当于给深层页开了一条横向通道,能显著缩短它与其它页面的距离。
- 标签聚合与专题页:把分散的深层内容归到一个中间层,让蜘蛛一次进入就能带走一批 URL。但要控制数量,避免生成大量内容单薄的聚合页。
- 导航与首页精选入口:把真正重要的栏目固定放在导航或首页,这几条链接的权重最高、回访也最勤。
- Sitemap 兜底:深层 URL 可以放进 Sitemap,作为站内路径之外的补充。它是补充手段,不宜当成唯一入口。
用访问日志验证深度假设
层级设计得合不合理,最终要看蜘蛛的实际行为。把访问日志按 URL 分组,重点看三件事:
- 各深度层级的 URL 分别被访问了多少次,深层是否明显偏少;
- 每个 URL 最近一次被抓取是什么时候,有没有长期未回访的页面;
- 返回状态码是否集中在某一层出现异常,比如深层的 301 链路过长或大量 404。
如果发现某一层的抓取量断崖式下跌,通常说明上层的入口链接出了问题,而不是蜘蛛“放弃了”这些页面。
几个容易踩的坑
一是为了压深度把首页做成巨型链接列表,结果重要入口被稀释;二是给深层页加了一堆链接,但锚文本全是“点击这里”,蜘蛛和用户都看不出主题;三是只盯着 Sitemap 提交数量,却忽略了站内路径是否通畅。深度问题很少单独存在,它往往和内链结构、分页设计、聚合页质量绑在一起。
小结
抓取深度本质上是路径问题:跳数越少,蜘蛛发现和回访的概率越高。把重要内容放在浅层,给深层内容补上横向入口,再用日志核对实际抓取分布,比反复猜测蜘蛛的偏好更有效。站点结构一旦调整,记得留出几周时间观察日志变化,再判断这次改动是否奏效。