很多人排查收录问题时,习惯从内容质量和 sitemap 入手,却忽略了一个更基础的东西:蜘蛛要花多少步才能从首页走到这个页面。这个步数就是点击深度(click depth),也有人叫爬取深度。它不决定页面能不能被收录,但会明显影响“多久被发现”“多久被重爬一次”。
点击深度指的是什么
从站点入口页(通常是首页)出发,沿着可点击的链接到达目标页面所需的最少点击次数,就是点击深度。注意几个限定:
- 只算 HTML 里可以跟随的链接,JS 点击事件、需要交互才出现的链接不算;
- 算的是最少步数,不是唯一路径;
- 入口不止首页,sitemap、栏目页、站内搜索也能算入口,但常规口径仍以首页为主。
所以首页直达是深度 1,首页 → 栏目 → 详情是深度 2,再往下每加一层列表,深度就加 1。
为什么深度会牵扯到收录
蜘蛛每次来站的抓取量是有限的,它会按一定预算分配请求。深度越大的页面,越容易被排在后面;预算用完,就只能等下一次。结果就是:浅层页面几小时、几天就有变化,深层页面可能要等几周,甚至长期停在“已发现,尚未抓取”。
另外,深度往往和内链数量、被引用次数绑在一起。深层页面通常内链少、外部链接也少,等于既难被发现,也难被判断为重要。两件事叠在一起,就表现为“内容不差,就是不收录”。
怎么量自己站点的点击深度
不需要很复杂的工具,用爬虫类工具跑一遍就能看到每个 URL 的 Depth 字段,也可以自己从首页做几次广度优先的跳转记录。看三个数就够:
- 站点最大深度是多少,主要收录页面一般建议控制在 3~4 次点击以内;
- 有多少 URL 深度大于 4,这些是重点观察对象;
- 有多少 URL 只能通过 sitemap 找到,站内没有任何链接指向(孤岛页面,本质上深度无限)。
深度不是越浅越好。把所有页面都塞进首页,会稀释首页的链接价值,也会让用户和蜘蛛都找不到重点。关键是让重要页面浅,让不重要页面能被发现但不抢资源。
几个常见误区
- 只加 sitemap,不改内链。sitemap 是入口之一,能帮助发现,但不构成内链关系;只靠 sitemap 的页面,重爬频率通常明显偏低。
- 用 JS 渲染的导航。如果栏目导航依赖 JS 生成,蜘蛛可能看不到这条路径,实际深度比你自己点出来的更深。
- 无限滚动加“加载更多”。滚动加载的内容对爬虫不一定是可跟随链接,分页链接保持在 HTML 里更稳妥。
- 把目录层级当成点击深度。URL 里的 /a/b/c/ 和点击几次完全不是一回事,目录深不等于点击深,反之亦然。
把深度压下来的几种做法
- 栏目列表页做合理分页,并给旧内容保留可达路径,而不是只展示最近 20 条。
- 加相关阅读、热门内容、上下篇等模块,让详情页互相连接,给深层页面更多入链。
- 用标签页、聚合页做横向连接,但要控制数量,避免生成大量低质列表页。
- 重要板块稳定放在全站导航或首页,别随活动频繁变动位置。
- 定期复查孤岛页面:要么给它内链,要么承认它不重要。
什么时候可以不用管深度
如果站点页面量很小(几百以内),或者内容更新频率本来就低,深度带来的差异不会太明显,优先级可以往后放。相反,页面量上万、更新频繁的站点,深度是抓取效率里最值得先调的一项。
最后提醒:点击深度是“发现与重爬”的优化项,不是收录开关。页面能不能进索引,最终还是回到内容本身、重复度、URL 规范这些老问题。把深度理顺,只是让蜘蛛更省力地走到你希望它看到的页面。