网站收录

站内链接深度:页面埋得越深,被发现和重抓的机会越少

很多收录问题不在内容本身,而在页面所处的站内位置。本文从链接深度入手,说明如何自查页面离首页几跳、入口数量是否足够,以及哪些看似存在的链接其实起不到发现作用,并给出一个成本较低的改善顺序。

网站收录

站内链接深度:页面埋得越深,被发现和重抓的机会越少

排查收录问题时,很多人先看内容质量、robots 规则、站点地图,却忽略了一个更基础的因素:这个页面在站内处于什么位置,从首页点几下能到。链接深度不决定收录结果,但它实实在在影响页面被发现的概率和频率。

链接深度为什么会影响收录节奏

搜索引擎发现 URL 的主要渠道之一是站内链接。爬虫沿着链接一层层往下走,页面离首页越远,被走到的机会就越少,被抓取的间隔也越长。深度大的页面,可能几天甚至几周才被访问一次。

深度还会影响重抓节奏。一个经常被内链指向的页面,内容更新后往往能较快被重新抓取;而深埋在角落里的页面,即使更新了内容,也可能长时间停留在旧版本上,让人误以为是索引出了问题。

先做一次链接深度自查

  1. 从首页出发,记录到达目标页面最少需要几次点击;
  2. 用站内搜索或站内链接检查,看还有哪些页面链接到它;
  3. 把入口链接按来源分类:导航、分类页、正文内链、页脚、侧栏;
  4. 查看这些来源页面本身是否已被收录、是否经常被抓取。

常见经验是把重要页面控制在三次点击以内,但这只是参考值,不是硬性标准。真正需要关注的是入口数量和入口本身的质量,而不是单纯数层级。

入口数量和质量,比层级更值得看

一个页面如果在多个被频繁抓取的页面里出现,即使层级深一点,被发现的机会也不低。反过来,只有一个链接、且来自一个同样很少被抓取的页面,就算层级只有两层,也可能长期不被访问。

  • 入口数量:只有一两个内链入口的页面,风险较高;
  • 入口页面质量:来源页面是否被收录、是否有稳定的抓取;
  • 链接位置:正文里的上下文链接,通常比页脚、侧栏的批量链接更有效;
  • 锚文本是否可读:写成「点击这里」这类无意义文本,入口的作用会被削弱。

常见的几种假入口

有些链接看起来存在,实际对发现页面帮助有限,排查时容易误判。

  • 链接由脚本在点击后才生成,HTML 源码里并没有可直接抓取的地址;
  • 内链指向的地址要经过多次跳转才到目标页,链路越长越容易被放弃;
  • 链接被 nofollow 或 robots 规则挡住;
  • 链接藏在需要展开、点击「更多」才出现的模块里;
  • 列表页里目标条目排在很靠后的位置,且没有其他入口。

改善顺序:先让入口有效,再考虑提交

调整时按下面的顺序做,成本和收益比较可控。

  1. 把重要页面放进主导航或分类页,确保源码里就有可抓取的普通链接;
  2. 在主题相关的正文里补充上下文内链,让入口出现在真实阅读路径上;
  3. 清理重定向链,让内链直接指向最终地址;
  4. 修掉会阻断抓取的规则,例如误写的 robots 或页面级 noindex;
  5. 最后再用站点地图和提交接口做补充,而不是一上来就依赖它们。
站点地图和提交接口解决的是「告知一次」,站内链接解决的是「持续被发现」。两者不能互相替代,入口没打通时,单靠提交往往看不到稳定变化。

链接改善之后,再回到其他维度

如果入口已经补上、链接深度也合理,页面仍然长期不被收录,那就要换方向排查:内容是否与站内其他页面高度重复、URL 是否规范、页面是否需要渲染后才出内容、是否存在返回 200 却空白的软 404 情况。

链接深度只是让页面「被看到」的一环。能不能进入索引,最终还要看这个页面本身是否值得被保留。把入口问题和其他维度分开处理,排查起来会清楚很多。