网站收录

点击距离与内链深度:页面收录迟迟不动的入口排查顺序

页面内容没问题、状态码正常,却长期不进索引,问题有时出在更前面:爬虫能不能顺着链接走到它面前。本文按入口类型和点击距离梳理排查顺序,区分“发现层面”与“页面层面”的问题,并给出补链的优先级,帮助判断该先改哪里、后看什么。

网站收录

点击距离与内链深度:页面收录迟迟不动的入口排查顺序

很多站长查收录时,习惯盯着页面本身:内容够不够厚、有没有 noindex、状态码是不是 200。但有一类页面,内容过关、状态码也正常,就是长期不进索引,问题出在更前面的一步——爬虫能不能顺着链接走到它面前,以及要走几步才能走到。这就是点击距离和内链深度要解决的问题。

一、先分清:是没被发现,还是被发现没被收录

点击距离影响的是“发现”这一层。如果目标页面从来没有出现在抓取日志里,那大概率是入口的问题;如果已经被抓过几次却没进索引,那就该回到页面质量和信号层面去看。两者排查方向完全不同,混在一起只会来回改、看不出效果。

判断方法很简单:翻服务器日志,看爬虫有没有对这条 URL 发起过请求。完全没有记录,就重点查入口;有请求记录但索引里没有,就别再纠结内链了。

二、量一下点击距离

点击距离是指从已知入口(通常是首页或主要列表页)出发,需要点几次链接才能到目标页。可以粗略分档来看:

  • 一层:首页直接链接,比如主导航里的栏目页;
  • 两到三层:分类页、子栏目页,属于爬虫经常光顾的范围;
  • 四到五层:较深的内容页,抓取频率开始明显下降;
  • 五层以上:基本只能靠 sitemap 或外部链接被发现,重新抓取的间隔会拉得很长。

并不是越浅越好,导航也不该被塞满。但如果一个页面超过四层,又没有任何横向入口指向它,那它的发现效率就很难保证。

三、按入口类型逐项核对

同样是内链,作用并不一样。建议按下面的顺序检查:

  1. 主导航和面包屑:是否覆盖主要栏目,面包屑是否输出真实链接而不是纯文字;
  2. 分类列表页:新页面上线后,有没有进入对应列表的前几页,而不是只躺在最后一页;
  3. 相关推荐、上下篇:能不能把同主题的深层页横向连起来;
  4. 站内搜索、标签聚合:是否对爬虫开放,还是被整体屏蔽了;
  5. sitemap:是否包含这条 URL,深层页有没有被漏掉。

其中最容易忽视的是横向链接。纵向层级由站点结构决定,改起来牵一发动全身;而相关推荐和上下篇属于内容层面的补链,成本低,也更容易随内容更新持续生效。

四、几种让点击距离被“虚增”的结构

有些页面看起来层级不深,实际爬虫走起来却很深,常见原因有:

  • 列表页只有第一页有真实链接,后面的内容靠 JS 加载;
  • 导航用 JS 事件跳转,而不是 a 标签的 href;
  • 筛选、排序参数把同一个列表拆成大量版本,爬虫走进参数迷宫;
  • 重要页面只挂在页脚的全站链接里,被大量无关链接稀释;
  • 分页被 nofollow,导致后续页面的链接链路中途断开。

这些问题的共同点是:人能看到,爬虫不一定能走通。核对方式是用纯文本方式查看页面,或者在禁用 JS 的情况下看链接是否还在、href 是否可点。

五、补链的优先级怎么排

不是所有深层页都值得补链,可以按重要程度分档处理:

  1. 核心转化页和重点内容页优先,直接在相关文章、列表页、导航中加链接;
  2. 时效性较强的内容,放在首页或栏目显眼位置,过期后再撤下;
  3. 长尾页、归档页,靠 sitemap 和分类聚合覆盖即可,不必强行提到首页;
  4. 纯功能页、参数页,先评估是否值得保留入口,再决定补链还是收口。
补链解决的是“被发现”,不保证“被收录”。如果页面本身内容单薄、与站内其他页高度重复,补再多的链接也只是让它被抓得更频繁,不一定进索引。

六、补完之后先看什么

补完链接不要立刻盯着索引量。建议按这个顺序观察:先看日志里该 URL 的抓取次数有没有变化,再看抓取时返回的状态码和内容是否符合预期,最后才去看索引状态。这个顺序能帮你分清:到底是入口没通,还是页面本身还没达到收录条件。

点击距离是一个容易被忽略的排查项,因为它不在页面内部,而在页面与页面的关系里。收录出问题时,先确认爬虫能不能走到,再谈页面质量,往往能少走几段弯路。