有些站点内容并不差,问题出在“够不着”。蜘蛛从首页出发顺着链接一层层走,如果某个栏目要翻三次列表才露面,或者一篇文章只有站内搜索才能找到,那么它被发现的概率就会明显下降。点击深度就是衡量这件事的一个简单指标:从首页到目标页面,最少需要点几次。
点击深度量的是什么
点击深度通常指从首页出发,沿站内链接到达某个页面所需的最少点击次数。首页算第 0 层,主导航直接指向的栏目是第 1 层,栏目列表里的文章是第 2 层,再往里就要继续翻列表或走内链。
它和 URL 里的目录层级不是一回事。一个页面可以是 /a/b/c/d/ 这样看着很深的路径,但只要首页上就有直达链接,它的点击深度仍然是 1;反过来,一个 URL 干干净净的页面,如果只能从第五页列表点进去,实际深度就是 5。
为什么值得单独查一遍
点击深度偏大带来的影响,通常是叠加出现的:
- 发现成本变高。蜘蛛需要走过更多中间页才能触达深层内容,中间任何一环没被有效抓取,后面的页面就跟着被挡在外面。
- 抓取预算被摊薄。分页列表、归档页、筛选页本身也需要抓,深度越大,花在“路上”的请求就越多。
- 用户路径同样变长。人找不到的内容,链接自然少,页面在站内的位置会越来越边缘。
需要说明的是,深度大不等于页面没价值。很多网站的旧文章、长尾内容本来就在深层,关键在于它是否只有深这一条路可走。
自查:三种把深度量准的办法
用爬虫工具跑一遍
把首页作为起点,限制只跟随站内链接,导出每个页面的“层级”或“点击深度”字段,按数值从大到小排序。先看两端:深度超过 4 到 5 的页面里,有多少是你真正希望被访问的;再随机抽十几个,回到浏览器里手动点一遍,确认工具给出的路径是真实存在的。工具跑出来的深度是静态链接的深度,如果有大量链接靠脚本注入,结果会和实际情况有偏差,这点要留意。
从服务器日志反推
日志里不会直接写深度,但能反映结果。挑一批只在深层出现的 URL,看它们在一个月内被蜘蛛请求过几次。如果长期为零,而站点地图里确实提交过这些地址,基本可以判断是入口太窄,而不是地址本身有问题。同时看看 referer,能大致还原蜘蛛是从哪个页面走进来的。
人工抽查冷门页面
从后台内容列表里按发布时间或访问量排序,抽 20 篇左右,试着不用搜索框、只靠导航和列表找到它们,记录需要几次点击。这一步费时,但能发现工具测不出的问题,比如某些入口只在特定设备上显示。
常见的“埋深”场景
- 内容只在分页列表的第三页之后出现,且没有更靠前的入口。
- 只有标签聚合页能通到,而标签页本身又没进导航。
- 依赖站内搜索结果页作为唯一入口,蜘蛛一般不提交搜索词,等于进不去。
- 改版或栏目调整后,旧内容被挪进归档目录,但新导航里没有对应入口。
- 栏目页本身存在,却没有出现在任何导航或页脚里,只能靠站点地图发现。
调整时的几个动作
- 把重要栏目放回主导航。一级入口是控制深度的最直接手段,别把导航当成装饰。
- 做相关性内链。文章之间按主题互相指向,比在正文里堆一堆无关链接有效,也更自然。
- 控制列表分页的深度。与其让用户和蜘蛛一直往后翻,不如按时间或主题切分出更清晰的子列表。
- 用站点地图兜底。它不能替代链接,但可以作为深层页面的补充入口,前提是里面提交的地址确实可访问、可索引。
- 减少没内容的过渡页。只起跳转作用的中间层越多,深度就越容易被无意义地拉长。
点击深度是参考指标,不是越浅越好。首页如果塞进上百个链接,反而会让每个入口都变弱。合理的目标是:重要的内容在两三次点击内可达,长尾内容有稳定的入口,不必强求全部贴到首屏。
建议把这项检查放进固定周期里,比如每个季度或每次改版之后重跑一次。结构变动往往在不经意间把一批页面的深度推高,早发现比事后补内链省力得多。