搜索抓取

从首页到详情页要跳几次:点击深度如何影响 URL 被发现

点击深度指蜘蛛从首页出发、经过几次链接跳转才能到达某个 URL。层级越深,被抓取和回访的机会通常越少。本文说明蜘蛛为何偏向浅层页面、如何用爬虫工具和服务器日志测量实际深度,并给出用导航、相关推荐、专题聚合页压缩层级的做法,以及避免把全站链接堆到首页的注意事项。

搜索抓取

从首页到详情页要跳几次:点击深度如何影响 URL 被发现

一个 URL 被发现,往往不是因为它在 Sitemap 里,而是因为蜘蛛顺着某条链接走到了它。走这一趟需要几跳,就是点击深度。

点击深度是什么,为什么值得盯

点击深度是从首页算起,经过几次链接点击能到达目标页面。首页是蜘蛛最常访问、也最优先解析的页面,第一层链接获得的机会最多,越往下越少。这不是某条写在明面上的规则,而是抓取资源有限时的自然结果:蜘蛛每次来访的时间、带宽和可抓取的页面数都有上限,先用在容易走到的地方,剩下的排在后面。

蜘蛛为什么偏向浅的页面

多数抓取策略带有广度优先的倾向:先把同一层级能拿到的 URL 排队,再往下走。首页能分发的链接机会有限,如果首页只有几十个入口,第二层能分到的关注就那么多。再加上不少深层页面更新频繁却没人链,深度越大,被重复访问的概率越低。

深度通常来自两处

  • 结构深度:分类树本身很长,例如首页—一级类—二级类—子类—列表—详情。
  • 链接缺失:页面存在,但除了搜索框和 Sitemap,没有任何可点击链接指向它。

常见的深度陷阱

  • 入口只在站内搜索:搜索结果页一般不作为抓取入口,蜘蛛不会替你输入关键词。
  • 分页链太长:列表翻到第二十页以后基本没人走,而新的详情页只挂在那里。
  • 依赖 JS 加载列表:能用,但多一层渲染,出问题的概率也更高。
  • 筛选参数生成大量新路径:同一批内容被拆成无数层级,把抓取名额摊薄。
  • 导航只到分类页,详情页全靠加载更多。

先量一量,再动手

别凭感觉判断深度。可以做的几件事:用站内爬虫工具跑一遍,按距离首页的跳数排序,看看有多少重要页面落在四跳以外;翻服务器日志,观察蜘蛛实际到达的层级分布;把 Sitemap 里出现的 URL 和站内链接能覆盖到的 URL 做对比,差集往往就是只靠申报才被发现的页面。

压缩层级的几种做法

  1. 让分类页直接链到少量重点详情页,而不是只链下一个列表页。
  2. 增加相关推荐、最新更新这类模块,把不同分支的页面互相连起来。
  3. 用专题页、聚合页承接一批同类 URL,让它们从五跳变成三跳。
  4. 面包屑保证向上可走,路径断了的页面至少有一条回程。
  5. 把 Sitemap 当作补充申报通道,它能让蜘蛛知道地址存在,但缺少内链的页面在更新后仍然容易被忽略。
不要为了压深度把全站链接堆到首页。首页链接太多,每个链接分到的关注都会下降,反而稀释了真正重要的入口。

深度不是唯一目标

扁平化的前提是有取舍。重要页面两到三跳内可达,长尾内容四到五跳也能接受,真正的麻烦是重要页面比长尾还深。调整结构时,先在日志里确认蜘蛛已经在走新路径,再决定要不要继续拆层级。

上线后可以核对的清单

  • 首页到主要详情页的跳数是否稳定在三跳以内。
  • 新发布的 URL 是否在一天内至少被一条内链指向。
  • 是否存在只能靠 Sitemap 触达、站内没有链接的页面。
  • 列表分页是否给出了通往深层的替代入口。
  • 日志中蜘蛛到达的层级分布是否与预期一致。

点击深度不决定排名,但它决定蜘蛛能不能顺着路找到你。把路径理顺、把入口留够,剩下的交给时间和内容本身。