很多站点把内容做得很深:首页到栏目,栏目到分类,分类到列表,列表再翻几页才到详情页。对用户来说可能只是多点几下,但对搜索蜘蛛来说,每一次点击都意味着多一跳排队。点击距离(click depth)就是描述这件事的指标:从入口页出发,经过几次链接跳转才能到达目标 URL。
点击距离和目录层级不是一回事
目录层级看的是 URL 路径里有多少层,比如 /a/b/c/d/page.html;点击距离看的是实际链接路径有多长。两者经常一致,但也会分叉。有的页面 URL 很深,却在导航或首页推荐位有直达链接,点击距离很短;有的页面 URL 很浅,比如 /news/123,但只能从某个二级列表翻到第三页才能进入,实际点击距离反而更长。
蜘蛛的抓取排队通常会给入口附近、被多处链接指向的 URL 更高优先级。点击距离远的页面不一定不被抓,但被安排抓取的时间会更晚,更新后的回爬也可能更慢。
哪些结构会把页面推远
- 导航只放一级栏目,二级、三级页面只能靠层层列表进入。
- 列表分页很多,且没有查看全部或稳定的分页链接。
- 相关推荐、标签页只在详情页底部出现,入口单一。
- 专题页、活动页过期后从导航撤下,但没有留下其他入口。
- 重要页面依赖 JS 异步加载链接,抓取时可能拿不到完整路径。
在不堆砌链接的前提下把页面拉近
- 先统计重要 URL 的点击距离。可以从抓取日志、站内链接图或爬虫工具里抽样,重点关注产品、文章、帮助文档等高价值页面。
- 检查主导航能否覆盖核心栏目。如果某类内容重要,就让它在导航里有稳定入口,而不是只藏在某篇文章里。
- 给列表页和详情页加上面包屑。面包屑不仅告诉蜘蛛层级关系,也提供了一条从首页到深处的短路径。
- 在相关推荐、同栏目最新、热门排行等模块里,让深处页面获得自然的内链。注意相关性,不要为了缩短距离而批量塞入无关链接。
- 分页不要只留下一步。页码可点击、URL 稳定、翻页顺序清楚,蜘蛛才能顺着走完列表。
- Sitemap 作为补充入口。它不能替代内链,但可以帮助蜘蛛发现那些点击距离较远、没有太多内链的 URL。
用数据验证调整效果
调整完成后,不要只盯着收录数量。更实用的观察方式是看抓取日志:重要目录下的 URL 被访问的频率有没有变化,新发布内容从上线到第一次被抓的间隔是否缩短,更新后的回爬是否更及时。如果某个栏目长期只有列表页被爬,详情页很少出现,通常说明入口还不够近,或者链接路径存在断点。
点击距离是结构问题,不是链接数量问题。把入口理顺,比在页面里堆大量无序链接更有效。
总结一下:点击距离影响蜘蛛发现和安排抓取的顺序,目录层级只是其中一个表象。定期检查重要页面的入口链路,保证导航、面包屑、列表分页和相关推荐能形成稳定路径,再用 Sitemap 做补充,通常比反复提交 URL 更实在。