很多站长在排查收录慢的时候,第一反应是内容不够好,或者蜘蛛来得太少。但还有一个常被忽略的因素:页面离首页有多远。从首页出发,顺着一层层链接点到某个页面需要点几次,这个次数就是它的链接深度,也叫点击距离。
点击距离是怎么算的
首页算第 1 层,直接挂在首页导航下的栏目页是第 2 层,栏目页里的文章是第 3 层。如果再往下有子分类、标签页、归档页,深度就会继续累加。常见的站点结构里,大多数内容页落在第 3 到第 5 层之间,超过 5 层才能点到的页面就要留意了。
这里的层数是按最短路径算的,不是按目录层级算。URL 里写了几级目录,和点击距离是两件事。一个形如 /a/b/c/d/page.html 的地址,如果首页某个区块直接链过去,它的点击距离就只有 1。
为什么深一点就可能拖慢收录
搜索引擎的爬虫从首页开始,顺着链接一层层扩散。深度带来的影响主要体现在三个方面:
- 发现顺序:浅层页面几乎每轮抓取都会被走到,深层页面要等前面几层都爬完才有机会被碰到。
- 抓取配额:站点每天能被抓取的页面数量是有限的,配额通常优先分给首页附近、更新频繁、内链多的页面。
- 重访频率:浅层页面可能几天就重抓一次,深层页面可能几周才轮到一次,内容更新后重新被评估的机会自然更少。
需要说明的是,深度本身不是惩罚。搜索引擎并没有超过几层就不收录的规则,现代爬虫也不会因为深度大就放弃一个页面。真正起作用的是:深层页面被发现得更晚,能分到的抓取次数更少,于是它在索引里更新得更慢。
深度不是单独起作用
同样是第 5 层,一个页面有一堆相关文章链过来,另一个只有父级栏目链过去,结果可能完全不同。判断时要一起看:有多少内链指向它、这些链接出现在哪些页面、锚文本能不能说明页面主题、页面本身有没有可索引的价值。深度只是其中一个变量,不是决定因素。
自查:先看深度分布和日志
- 用爬虫工具跑一遍站点,看各个层级的页面数量和占比,找出最深的几批 URL。
- 翻服务器日志,统计深层目录的抓取频次,和浅层目录做对比。
- 在站长工具里看已发现但尚未编入索引的 URL 分布,是否集中在某几个目录。
如果某批 URL 深度很大、日志里几乎没有抓取记录,那问题大概率出在结构上,而不是内容质量。
几种把页面变浅的做法
增加中间层入口
把内容量大、更新频繁的分类做成专题页或聚合页,作为中间枢纽,让原本要 5 次点击才能到的页面缩到 3 次。枢纽页本身要有实际内容,不能只是标题列表的堆砌。
用好面包屑和相关推荐
面包屑能让深层页面多一条回到上级和首页的路径;文章底部的相关推荐则能横向连接同主题页面,让蜘蛛从一个页面走到另一个页面,而不是每次都退回首页重新走一遍。
站点地图当补充,不当主力
sitemap 可以帮助发现一些缺少内链的页面,但它不解决页面太深的问题,也不保证抓取顺序。真正的通道还是站内链接。
扁平化的边界
把所有链接都堆到首页,会让首页链接过于分散,每个页面分到的权重更少,用户也找不到重点。合理的做法是:首页和主导航放最重要的栏目和常青内容,其余页面通过分类页、专题页、相关推荐逐步下放。层级存在是正常的,只要不是必须绕好几圈才能点到。
一个简单的判断顺序
- 先确认页面本身值得收录:有独立内容,不是重复页或空壳页。
- 再看它从首页出发需要几次点击,超过 4 到 5 次的重点页面,考虑补一条更短的路径。
- 然后看它有多少内链、锚文本是否合理。
- 最后对比日志里的抓取频次,判断是结构问题还是抓取配额问题。
链接深度不会单独决定收录,但它决定了页面多快被看到、多久被重访一次。把重要页面的路径缩短,通常是结构调整里性价比比较高的一步。