做收录排查时,多数人盯着页面本身:内容够不够、canonical 对不对、有没有被 noindex。但还有一个更前置的问题常被忽略——从首页出发,需要走几次链接才能到达这一页。这个距离一般称为点击深度,它影响的是页面能不能被稳定发现,而不是页面内容好不好的问题。
点击深度影响的是“发现”,不只是“排序”
搜索引擎的抓取大致沿着链接扩散:从已知的种子页面出发,顺着站内链接一层层往外走。深度越大的页面,处在扩散链条的末端,会遇到几个具体问题:
- 发现概率降低:中间任何一层出现死链、noindex 或过长的重定向链,都可能让扩散提前中断。
- 抓取顺序靠后:同样是新发现的 URL,浅层页面通常先进入抓取队列,深层页面排在后面。
- 重访频率偏低:深页拿到的新鲜内链少,内容更新之后重新被抓的时间往往更长。
- 参数与近似 URL 更容易分叉:层级越深的列表结构,越容易生成大量相似地址,分散本就有限的抓取资源。
什么样的深度值得关注
不必把“三层以内”当成铁律,但可以用它做一次粗略对照:首页算第 0 层,主导航指向的栏目是第 1 层,分类列表是第 2 层,普通详情页是第 3 层。多数内容型站点的重要页面,集中在 3 层以内是比较常见的结构。如果核心页面需要 5 次以上点击才能到达,就值得单独查一查。
更重要的是区分两类页面:一类是内容确实重要、但入口太窄;另一类是数量庞大、本身价值有限的长尾页。前者值得补入口,后者更适合用站点地图或列表分页来管理,而不是硬塞进主导航。
怎么量出真实的点击深度
- 用站内爬虫工具跑一遍全站,导出每个 URL 的深度和内链数量,先看整体分布,而不是盯着单页。
- 对照服务器日志,看爬虫实际抓取的地址集中在哪一层,和你的预期是否一致。
- 抽查几个“收录慢”的页面,统计站内有多少个不同页面链接到它——只有一个入口的页面,抗风险能力很弱。
- 把浅层和深层页面的收录情况分开统计,如果差距明显,层级因素基本可以确认。
把过深的页面拉近,常用的几种做法
- 完善面包屑和主导航:让栏目路径每一层都可以点击,这是最基础的入口。
- 补横向链接:在相关文章、上下篇、同标签内容之间互链,让深层页从多个方向都能到达。
- 列表页分页合理放行:让较早的内容不会因为翻到第二十页就彻底断掉入口。
- 做一份 HTML 站点地图:把需要被发现的页面集中放在一个浅层页面上,作为兜底入口。
- 减少无意义的中间跳转页:那些只有一句“点击进入”的过渡页,除了增加深度之外没有别的作用。
别把“拉平”做成链接堆砌
有一种常见的过度反应:把全站链接塞进页脚,或者在每个页面底部挂几百个“热门推荐”。这通常不会加快收录,反而会让页面上的链接失去区分度,爬虫也未必按你设想的顺序走。
层级浅只能提高被发现的概率,不能替代内容本身的价值判断。入口铺好之后,页面能不能进索引,仍然取决于它自身的内容质量和站点的整体状况。
实际排查时,把点击深度当成一个筛选条件而不是最终结论:先用它找出入口偏少的页面,再去检查这些页面在内容、模板、URL 规范上有没有别的问题。顺序对了,排查效率会高很多。