很多站点都有这样一个现象:首页和栏目页被抓取得很频繁,深藏在三级、四级目录下的页面却长期停在「已发现未抓取」。排除内容质量和外链因素之后,常见的原因就是页面的点击深度太深——从首页出发要经过很多次跳转才能到达,抓取程序自然很难把它排进队列前排。
点击深度是什么,为什么值得单独看
点击深度指的是:从站点任何一个高频入口(通常是首页)出发,到达某个页面最少需要点击多少次链接。它和 URL 层级并不完全等同。一个 /a/b/c/d/ 形式的地址,如果被首页导航直接链接,深度就是 1;而一个根目录下的页面,如果只能靠站点地图找到,实际的入口深度反而接近「没有」。
在分配抓取资源时,能顺着已有页面链接找到的地址通常会被优先照顾。深度越浅,被反复访问和重新抓取的概率越高;深度过深的页面,即便内容不错,也容易长期排在队列末尾。
几个容易被忽略的深度陷阱
- 只有站点地图,没有站内链接:页面能被「发现」,但缺少持续的入口。
- 导航里的链接靠脚本拼出来:抓取与渲染不同步时,入口等于不存在。
- 列表页只放出最近若干页,老内容被挤出可达范围。
- 面包屑指向分类首页,但分类首页不链接回子页,形成单向路径。
- 换域名或调整目录后旧链接断掉,新路径没有补上对应的内链。
导航、面包屑与列表页的分工
这三者的作用并不相同。全局导航负责把主要栏目控制在浅层,让重要内容始终有稳定的入口;面包屑负责让每个详情页都有回到更高层级的路径,同时帮助理解层级归属;列表页和相关推荐则负责给内容页提供多条入口,避免一个页面只靠一条路径到达。
比较稳妥的做法是:重要栏目在三层以内就能从首页到达;详情页至少有两个以上不同的内链入口;列表页做分页时保证旧内容仍有出口,比如按时间归档或按标签聚合。
自查顺序可以这样排
- 先挑一批长期停在「已发现」状态的 URL,列出它们目前的实际入口。
- 从首页出发手动点一遍,记录真实点击次数,和预期深度做对比。
- 检查导航与面包屑的链接是否是可抓取的普通链接,而不是依赖点击事件。
- 看列表页和归档页是否覆盖到较老的内容,还是只保留了最近一批。
- 确认改版后的新路径有内链承接,旧路径有合适的跳转处理。
- 把高频更新的页面固定在较浅位置,低频页面允许沉得深一些。
深度不是唯一变量
点击深度影响的是「被找到的效率」,而不是「会不会被收录」。内容重复、页面质量偏低、站点整体抓取额度紧张,都可能让浅层页面同样进不了索引。解决深度问题,只是排除了一类干扰项。
用一张简单的台账跟进
可以按页面类型记录几项信息:典型点击深度、主要入口来源、上次被抓取的时间、当前索引状态。每隔一段时间抽样对比,如果某一类页面的深度在变大,比如列表页翻页被截断、导航改版后少了入口,往往就是收录变慢的前兆。
与其反复提交地址,不如先把从首页到目标页面的路径理顺。路径通畅的站点,抓取和收录这两件事通常都会省心一些。