判断一个页面能不能被访问,除了看它是否存在、是否返回 200,还有一个常被忽略的维度:从首页出发,要点几次链接才能到它。这个距离就是点击深度。它不直接决定抓取结果,但会影响页面被发现的效率,尤其是新发布的内容。
点击深度到底在说什么
点击深度指的是从网站首页(或任一入口页)开始,沿着链接跳转,到达目标页面需要的最少点击次数。首页是第 0 层,主导航里的一级栏目是第 1 层,栏目下的列表页是第 2 层,列表里的详情页通常是第 3 层。层级越多,意味着页面越靠外缘。
需要注意的是,这是最短路径,不是唯一路径。同一个页面可能既在栏目列表里出现,也在推荐位、相关阅读、站点地图里出现。自查时要看的是最短的那条路径有多长,而不是最长的那条。
层级为什么会一层层变深
- 栏目越拆越细:为了方便分类,把一个栏目拆成子栏目、子子栏目,每一层都只是一个中间页。
- 列表页分页太深:文章只出现在很靠后的分页里,前面的分页翻不到。
- 只靠搜索框和筛选:页面本身没有静态链接入口,只能通过站内搜索或参数筛选到达。
- 相关文章乱推荐:把详情页只链到另一个详情页,链条越接越长。
- 归档页不参与导航:按时间归档的页面没有被任何列表或导航引用。
自查时可以看的几个地方
抓取日志
在服务器访问日志里,观察蜘蛛实际请求的 URL 分布。如果大部分请求集中在首页和少数几个栏目页,而详情页很少被碰到,通常说明入口太窄或者层级太深。日志里同一页面被反复抓取而新页面迟迟不出现,也值得留意。
站点地图与实际链接的对照
站点地图能提交很多地址,但它更像一份清单,不等于页面被链接到了。可以把站点地图里的 URL 抽样几个,回到站内找找看:从首页出发能不能点到?要在几次点击之内?如果站点地图里有、站内却几乎点不到,那这些页面长期只能靠地图喂给搜索引擎,更新和重新发现都会慢一些。
内链结构抽查
挑几个你认为重要的页面,用站内搜索或导航找一下它们的入口。常见的情况是:新文章只出现在首页的最新区块,滚动几天就被顶下去了,之后再也没有别的入口。
把层级压回来的几种做法
- 一级栏目保持少而稳:主导航尽量控制在可读的范围内,每个栏目都要有实际内容和列表入口。
- 列表页做静态分页,并保证前几页有稳定入口:不要让内容只藏在很靠后的页码里。
- 善用聚合页和专题页:把同一主题的页面用固定 URL 的聚合页串起来,给它一个从栏目可达的位置。
- 相关阅读做交叉链接:详情页之间互相链接是可以的,但最好同时有一条回到栏目列表的路径。
- 归档、标签页如果保留,就让它可点:要么进入导航,要么至少在文章底部有入口。
不要走极端
点击深度是效率问题,不是生死线。把首页塞满几百个链接、把每个页面都堆到导航里,反而会稀释权重、拉长页面。目标是让重要内容有一条短而清晰的路,不是把所有内容都赶到第一层。
这类自查不需要复杂工具,一张站内链接草图、一次日志抽样、几轮手动点击就能看出问题。每隔一段时间检查一次栏目层级和入口链接,比等到内容堆积起来再返工要省事得多。