站点运营

站点运营:导航层级与点击深度自查,别把重要内容埋到第五层

点击深度决定蜘蛛发现内容的难易。本文整理了点击深度的自查方法、几种容易把页面越埋越深的结构问题,并给出梳理栏目层级、补固定入口、完善面包屑等调整思路,帮助站点把重要内容放到更容易被抓取的位置。

站点运营

站点运营:导航层级与点击深度自查,别把重要内容埋到第五层

点击深度(click depth)指从首页出发,沿着站内链接走,到某个页面需要经过多少次跳转。这个数字看起来只是结构问题,实际会直接影响蜘蛛能不能稳定地发现并回访你的内容。

为什么层级会变成抓取的门槛

蜘蛛每次来站点,可用的抓取量是有限的。它会优先走导航、首页、列表中那些显眼的链接。如果一个页面的入口藏在很深的目录里,或者只靠某个低频列表页链过去,那么它被发现的周期就会明显变长,改动之后被重新抓取的时间也会被拉长。

更麻烦的是,深层页面的内链往往也少。没有其他页面指向它,蜘蛛即使抓到一次,也很难判断它值不值得再来。

先给自己的站点量一次深度

手工抽查几个关键页面

  • 首页到最重要的栏目页,通常控制在 1 次点击以内;
  • 到具体内容页,多数站点做到 3 次点击以内比较舒服,超过 4 次就要想想是否必要;
  • 顺手看看这些路径用的是不是可点击的 a 标签,而不是只有 JS 事件或纯样式模拟的按钮。

用数据交叉验证

把服务器日志里的蜘蛛访问记录,和站点自身的链接关系对一遍。如果某些页面长期只有零星抓取,甚至只在 Sitemap 里出现过,那基本可以判断它的入口太偏了。

几种把页面越埋越深的结构

  • 目录无意义地层层嵌套:为了分类好看,硬生生加出四级五级目录,实际内容量撑不起这个层级。
  • 列表页只放最新几条:旧内容一旦被挤出第一页,后面的分页又没人链,就慢慢沉底了。
  • 导航依赖悬停或折叠菜单:不展开就不出现在 HTML 里,蜘蛛看到的导航和用户看到的不一样。
  • 侧栏推荐是随机或轮播:每次刷新链接都不同,等于把所有页面都摊薄成很低的权重。
  • 面包屑只显示最后一级:本来可以补一条向上路径,却白白浪费了。

调整时的几个做法

  1. 把栏目按真实内容量重新梳理,能合并的合并,不要为了结构完整凭空造分类。
  2. 给重要页面在首页或高权重栏目里安排固定入口,而不是只依赖列表翻页。
  3. 补一个 HTML 版本的站点地图页,把主要栏目和重点内容按层级列清楚,注意只放真正需要被抓的地址。
  4. 让面包屑层级完整,每一级都是可点击的链接,方便蜘蛛逐级回退。
  5. 调整后观察一段时间日志,看目标页面的抓取频次有没有变化,再决定是否继续加入口。

几个容易踩的边界

层级不是越浅越好。把所有页面都堆到首页,会让首页链接过多、权重分散,真正重要的内容反而不突出。合理的做法是让重点页面浅、长尾页面深一些,而不是一刀切。
  • 改导航结构时要保留旧入口的跳转,避免原有路径直接失效;
  • 不要把「点击深度」和「URL 目录深度」混为一谈,URL 长不代表路径深,反之亦然;
  • 列表页分页不要设太深,后面的页码既没人点,也不值得全部暴露给蜘蛛。

小结

导航层级和点击深度属于结构层面的基础工作,改动成本不高,但收益往往是长期的。定期抽查几个关键页面的路径,比等到发现收录变慢再回头找原因要省事得多。