蜘蛛从首页出发,沿着链接一层层走到详情页。这个过程中经过的层级数,通常被称为抓取深度。它不只是一个结构问题,更直接影响新页面被发现的快慢,以及蜘蛛把时间花在哪些地址上。
抓取深度到底指什么
日常沟通里,抓取深度经常混着三个概念,先分开看会更清楚。
- 点击深度:从首页出发,点几次链接能到达目标页。三次以内通常算浅,五次以上就偏深。
- 目录层级:URL 路径的层级,比如 /a/b/c/d/。它和点击深度有关,但不是一回事,URL 深不代表一定要点很多次。
- 链接深度:蜘蛛实际沿着内链爬行时经过的跳数。同一页面可能有多个入口,最短的那条路径更重要。
对抓取来说,最值得关注的是最短路径。如果详情页只能从某个深层列表页进入,而首页没有更短的通道,蜘蛛到达它的频率就会低很多。
层级过深会带来什么
层级本身不是问题,问题在于蜘蛛的抓取时间和请求量都有限。路径太深时,常见的情况有几类。
- 新页面迟迟不被发现,或者被发现后很久才再次回访。
- 列表页和中间页占据了大量抓取量,详情页拿到的份额变少。
- 部分页面只有一条很深的入口,一旦中间页改版或失效,就变成孤岛。
- 分页、筛选参数层层叠加,蜘蛛在同一个栏目里反复打转。
这些现象不一定会立刻表现在收录数字上,但会在日志里留下痕迹:抓取集中在少数入口,深层页面回访间隔明显拉长。
把层级压到合理范围
不需要把所有页面都做成扁平结构,那样反而会让首页链接过多、权重分散。更实际的做法是让重要内容有一条短路径,同时保留清晰的分类。
首页和栏目页的入口
首页适合放最核心的栏目和少量重点内容。栏目页承担主要的聚合作用,把该分类下最值得抓取的页面直接链出去。如果某个栏目下内容很多,考虑在栏目页增加热门、最新或精选区块,让深层页面获得更短的入口。
列表页与分页的衔接
列表页是详情页最常见的入口。分页不要只依赖加载更多按钮,至少保留可点击的翻页链接。翻页数量很多时,可以按时间或热度做归档入口,避免蜘蛛为了到达早期内容翻过几十页。
面包屑和上下文链接
面包屑能给蜘蛛一条回到上层的路径,也能让用户看清位置。文章正文里的相关阅读、上一篇下一篇,同样可以给深层页面增加入口。数量不用多,关键是链接指向真实相关的内容,而不是随机堆砌。
几个容易忽略的细节
- 导航里用 JavaScript 绑定点击、没有 href 的链接,蜘蛛通常走不通,尽量保留标准链接。
- 对整站导航或列表页滥用 nofollow,可能把详情页的入口一起挡掉。
- 筛选和排序参数生成大量 URL,会让蜘蛛在低价值页面上消耗抓取量,需要收敛。
- 站点地图能补充发现渠道,但不能替代内链。一个没有内链入口的页面,即使写进 Sitemap,抓取优先级也往往偏低。
怎么检查自己站点的抓取深度
- 从日志里抽取蜘蛛访问的 URL,按目录和路径归组,看抓取量集中在哪一层。
- 用抓取工具模拟从首页出发的爬行,记录每个页面被到达的最少跳数。
- 对照 Sitemap 和日志,找出只出现在 Sitemap、却很少被内链到达的地址。
- 抽查详情页,确认是否存在独立入口、面包屑和列表页入口。
抓取深度没有统一标准。对内容型站点,三到四次点击内到达详情页通常比较从容;对商品或文章量很大的站点,更重要的是让重要页面拥有多条短路径,而不是强行压缩层级。
把入口设计清楚,蜘蛛走的路就越接近你希望它走的路。与其反复提交地址,不如先检查首页到详情页之间,是否有一条稳定、简短、可以持续维护的链接通道。