点击深度(click depth)指从首页出发,沿着站内链接走,到某个页面需要经过多少次跳转。这个数字看起来只是结构问题,实际会直接影响蜘蛛能不能稳定地发现并回访你的内容。
为什么层级会变成抓取的门槛
蜘蛛每次来站点,可用的抓取量是有限的。它会优先走导航、首页、列表中那些显眼的链接。如果一个页面的入口藏在很深的目录里,或者只靠某个低频列表页链过去,那么它被发现的周期就会明显变长,改动之后被重新抓取的时间也会被拉长。
更麻烦的是,深层页面的内链往往也少。没有其他页面指向它,蜘蛛即使抓到一次,也很难判断它值不值得再来。
先给自己的站点量一次深度
手工抽查几个关键页面
- 首页到最重要的栏目页,通常控制在 1 次点击以内;
- 到具体内容页,多数站点做到 3 次点击以内比较舒服,超过 4 次就要想想是否必要;
- 顺手看看这些路径用的是不是可点击的 a 标签,而不是只有 JS 事件或纯样式模拟的按钮。
用数据交叉验证
把服务器日志里的蜘蛛访问记录,和站点自身的链接关系对一遍。如果某些页面长期只有零星抓取,甚至只在 Sitemap 里出现过,那基本可以判断它的入口太偏了。
几种把页面越埋越深的结构
- 目录无意义地层层嵌套:为了分类好看,硬生生加出四级五级目录,实际内容量撑不起这个层级。
- 列表页只放最新几条:旧内容一旦被挤出第一页,后面的分页又没人链,就慢慢沉底了。
- 导航依赖悬停或折叠菜单:不展开就不出现在 HTML 里,蜘蛛看到的导航和用户看到的不一样。
- 侧栏推荐是随机或轮播:每次刷新链接都不同,等于把所有页面都摊薄成很低的权重。
- 面包屑只显示最后一级:本来可以补一条向上路径,却白白浪费了。
调整时的几个做法
- 把栏目按真实内容量重新梳理,能合并的合并,不要为了结构完整凭空造分类。
- 给重要页面在首页或高权重栏目里安排固定入口,而不是只依赖列表翻页。
- 补一个 HTML 版本的站点地图页,把主要栏目和重点内容按层级列清楚,注意只放真正需要被抓的地址。
- 让面包屑层级完整,每一级都是可点击的链接,方便蜘蛛逐级回退。
- 调整后观察一段时间日志,看目标页面的抓取频次有没有变化,再决定是否继续加入口。
几个容易踩的边界
层级不是越浅越好。把所有页面都堆到首页,会让首页链接过多、权重分散,真正重要的内容反而不突出。合理的做法是让重点页面浅、长尾页面深一些,而不是一刀切。
- 改导航结构时要保留旧入口的跳转,避免原有路径直接失效;
- 不要把「点击深度」和「URL 目录深度」混为一谈,URL 长不代表路径深,反之亦然;
- 列表页分页不要设太深,后面的页码既没人点,也不值得全部暴露给蜘蛛。
小结
导航层级和点击深度属于结构层面的基础工作,改动成本不高,但收益往往是长期的。定期抽查几个关键页面的路径,比等到发现收录变慢再回头找原因要省事得多。