网站收录

深层页面迟迟不收录,先检查内链路径是否走得通

页面长期不收录,内容之外还有一个常被忽略的原因:站内没有稳定的链接路径。本文从点击深度、链接形式、日志核对几个角度,说明如何判断蜘蛛能不能走到深层页面,以及修正内链入口时的次序和常见误区。

网站收录

深层页面迟迟不收录,先检查内链路径是否走得通

很多人处理收录问题时,先想到的是改内容、提交 sitemap、加外链,却忽略了一件更基础的事:蜘蛛能不能沿着站内链接走到这个页面。一个页面如果长期只靠 sitemap 里的那一条记录被看到,而没有稳定的内链入口,它的抓取优先级和重访频率通常都不会理想。

URL 被发现之后,还需要一条能反复走的路

sitemap 负责“告诉”,内链负责“带路”。前者更像一次性的通知,后者是持续存在的通道。蜘蛛在正常爬行时主要靠链接扩散,如果某个页面在站内没有任何链接指向它,它就成了孤岛页面。孤岛页面即使被抓取过,也容易很快被遗忘。

点击深度:从首页到目标页要经过几跳

点击深度是一个很直观的指标:用户从首页出发,点几次能到达这个页面。深度越深,被抓取和重访的概率通常越低。

  • 核心页面尽量控制在三跳以内,能被导航、栏目页或面包屑直接指到;
  • 内容页至少要有栏目列表、相关推荐、上一篇下一篇中的一种入口;
  • 只在翻很多页之后才出现的列表页深处,通常需要额外汇总入口。

几种常见的“链接在,但路断了”

  • JS 生成的链接:用 onclick 跳转或前端路由生成的地址,如果没有对应的 a 标签,蜘蛛未必能顺着走。
  • 需要交互才出现的链接:点击“展开更多”“加载更多”才渲染出来的入口,抓取时可能根本不存在。
  • nofollow 用得太宽:整块导航或栏目链接全加 nofollow,等于主动收窄了通道。
  • 筛选和参数页吃掉入口:大量参数组合链接分散了爬行,真正的内容页反而没被走到。
  • 图片或图标承载链接:链接只写在图片上而不在 a 标签里,或者被脚本拦截。

用日志和索引状态做一次核对

  1. 挑出长期未收录的页面,先在蜘蛛访问日志里查它是否被访问过、访问频率如何;
  2. 再查这些页面在站内有多少条内链、分别来自哪些层级;
  3. 用抓取工具只开启 HTML 抓取,确认链接能否在源码中被识别;
  4. 对比入口页面本身是否收录,入口不收录,下游更难被走到。

修正时的几个做法

先补最少的必要入口,而不是全站铺链接。常见有效的做法包括:在栏目页做按时间或主题的汇总入口,在正文底部加同主题的相关内容模块,用面包屑把层级关系写清楚,把关键入口固定在页头或侧栏这类全站可见的位置。改完之后观察一段时间,看日志里这些地址的访问是否变多。

内链只解决“能不能被找到、能不能被走到”,不解决“这个页面值不值得被收录”。内容本身没有独特价值时,把路修得再好,结果也有限。

不要为了收录而过度内链

全站每页都挂上几百条链接,或者在页脚堆一批无关地址,反而会让重要链接被稀释,也容易被判定为异常。合理的做法是让链接关系与内容关系一致:相关的内容互相指向,重要的页面有更多入口,次要的页面也不至于断掉入口即可。