一个 URL 被发现,往往不是因为它在 Sitemap 里,而是因为蜘蛛顺着某条链接走到了它。走这一趟需要几跳,就是点击深度。
点击深度是什么,为什么值得盯
点击深度是从首页算起,经过几次链接点击能到达目标页面。首页是蜘蛛最常访问、也最优先解析的页面,第一层链接获得的机会最多,越往下越少。这不是某条写在明面上的规则,而是抓取资源有限时的自然结果:蜘蛛每次来访的时间、带宽和可抓取的页面数都有上限,先用在容易走到的地方,剩下的排在后面。
蜘蛛为什么偏向浅的页面
多数抓取策略带有广度优先的倾向:先把同一层级能拿到的 URL 排队,再往下走。首页能分发的链接机会有限,如果首页只有几十个入口,第二层能分到的关注就那么多。再加上不少深层页面更新频繁却没人链,深度越大,被重复访问的概率越低。
深度通常来自两处
- 结构深度:分类树本身很长,例如首页—一级类—二级类—子类—列表—详情。
- 链接缺失:页面存在,但除了搜索框和 Sitemap,没有任何可点击链接指向它。
常见的深度陷阱
- 入口只在站内搜索:搜索结果页一般不作为抓取入口,蜘蛛不会替你输入关键词。
- 分页链太长:列表翻到第二十页以后基本没人走,而新的详情页只挂在那里。
- 依赖 JS 加载列表:能用,但多一层渲染,出问题的概率也更高。
- 筛选参数生成大量新路径:同一批内容被拆成无数层级,把抓取名额摊薄。
- 导航只到分类页,详情页全靠加载更多。
先量一量,再动手
别凭感觉判断深度。可以做的几件事:用站内爬虫工具跑一遍,按距离首页的跳数排序,看看有多少重要页面落在四跳以外;翻服务器日志,观察蜘蛛实际到达的层级分布;把 Sitemap 里出现的 URL 和站内链接能覆盖到的 URL 做对比,差集往往就是只靠申报才被发现的页面。
压缩层级的几种做法
- 让分类页直接链到少量重点详情页,而不是只链下一个列表页。
- 增加相关推荐、最新更新这类模块,把不同分支的页面互相连起来。
- 用专题页、聚合页承接一批同类 URL,让它们从五跳变成三跳。
- 面包屑保证向上可走,路径断了的页面至少有一条回程。
- 把 Sitemap 当作补充申报通道,它能让蜘蛛知道地址存在,但缺少内链的页面在更新后仍然容易被忽略。
不要为了压深度把全站链接堆到首页。首页链接太多,每个链接分到的关注都会下降,反而稀释了真正重要的入口。
深度不是唯一目标
扁平化的前提是有取舍。重要页面两到三跳内可达,长尾内容四到五跳也能接受,真正的麻烦是重要页面比长尾还深。调整结构时,先在日志里确认蜘蛛已经在走新路径,再决定要不要继续拆层级。
上线后可以核对的清单
- 首页到主要详情页的跳数是否稳定在三跳以内。
- 新发布的 URL 是否在一天内至少被一条内链指向。
- 是否存在只能靠 Sitemap 触达、站内没有链接的页面。
- 列表分页是否给出了通往深层的替代入口。
- 日志中蜘蛛到达的层级分布是否与预期一致。
点击深度不决定排名,但它决定蜘蛛能不能顺着路找到你。把路径理顺、把入口留够,剩下的交给时间和内容本身。