网站收录

内页长期不进索引:从首页点击深度与内链分布开始的核对顺序

新页面长期停在“已发现,尚未抓取”,或者干脆没进索引,很多人先怀疑抓取频次。但更常见的原因是 URL 没有被有效发现:从首页到目标页要点击几次、链接是否可抓取、站点地图是否一致,都会影响发现效率。本文按从发现到抓取的实际路径,给出以入口深度和内链分布为起点的核对顺序。

网站收录

内页长期不进索引:从首页点击深度与内链分布开始的核对顺序

站点上线一批新页面,日志里搜索蜘蛛却很少走进这些地址,索引状态长期停在“已发现,尚未抓取”,或者干脆没有出现。这时候不少人会先去调蜘蛛池、改抓取频次,但真正决定页面能不能被发现的,往往是从已有页面出发的链接路径。按下面的顺序核对,更容易找到卡住的位置。

先分清:是没被发现,还是被发现后没抓取

这两种情况的处理方向完全不同。打开索引状态查询,看目标 URL 当前的覆盖状态;再对照服务器日志,看蜘蛛是否访问过这个地址。

  • 日志里完全没有记录、索引工具里也查不到,说明 URL 还没有进入发现队列,重点在内链和站点地图;
  • 日志里有访问记录,但状态长期不更新,重点在抓取、渲染和页面本身的质量判断。

把这一步做在前头,可以避免在错误的方向上反复调整。

第一步:数一数从首页到目标页要几次点击

从首页出发,顺着页面上真正可点击的链接走到目标 URL,记录中间经过的次数。层级越深,蜘蛛走到这里的概率越低。

  • 首页直达的栏目页、推荐位,通常最容易被发现;
  • 三级以内、每层都有稳定入口的页面,一般在较短周期内能被抓到;
  • 需要四五次点击、中间某一层链接还经常变动的页面,容易长期停留在未发现状态。

如果目标页确实处在很深的位置,优先考虑在相关栏目页或聚合页上补一条固定入口,而不是只依赖站点地图。

第二步:看内链是否真的通向它

页面上出现了链接文字,不代表蜘蛛能顺着走过去。逐项检查:

  1. 链接是否用可抓取的 a 标签和 href 书写,而不是点击事件或按钮;
  2. 链接上有没有被加上 nofollow;
  3. 所在区块是不是由 JS 延迟渲染,原始响应里根本没有这个链接;
  4. 链接是否被折叠、藏在标签页里,需要交互之后才出现。

另外注意单个页面上的链接数量。一个页面挂着几百条链接,真正有价值的入口会被稀释;反过来,只有页脚一条全站链接的页面,指向作用也比较弱。

入口要有相关性

内容相关的页面之间互相引用,比全站统一的页脚链接更有意义。同一主题的文章彼此引用、列表页里带位置的自然推荐,都是比较稳的入口形式。

第三步:新页面自己是否提供了可被发现的地址

有些页面本身没有任何对外链接,只在站点地图里出现过一次。站点地图能帮助发现,但它不是入口的替代品。需要核对:

  • 站点地图里的 URL 与实际地址是否完全一致,包括协议、域名、尾斜杠和参数;
  • 站点地图文件本身能否正常访问,有没有被 robots.txt 屏蔽;
  • 新页面发布后,相关列表页和栏目页是否同步更新了链接。

第四步:确认没有其他因素挡住发现

  • robots.txt 里是否误屏蔽了目录;
  • 页面是否返回 3xx 或 4xx,链接存在但跟随失败;
  • 整站入口是否只靠 JS 渲染,原始响应里几乎没有链接;
  • 页面是否被其他规则临时下线。

常见的误区

把收录问题全部归结为蜘蛛池或抓取频次,改善往往有限。抓取频次只是结果的一部分,前提是 URL 已经进入可发现的路径,并且链接能被正常跟随。

另一个误区是短期反复提交同一个地址。重复提交不会加快索引,反而让日志里出现大量相同请求。真正需要做的是补齐入口、修好链接,然后留出观察周期。

核对顺序小结

  1. 用日志和索引状态分清是未发现还是未抓取;
  2. 从首页数点击深度;
  3. 检查内链是否可抓取、是否有 nofollow、是否依赖 JS;
  4. 检查站点地图地址与实际地址是否一致;
  5. 检查 robots.txt、状态码与渲染方式;
  6. 补齐相关页面入口,隔一段时间再看日志变化。

页面被收录的前提是被发现并且被抓取,而发现主要依靠链接。把入口理顺之后,再去看抓取频次和索引状态的变化,判断会清晰很多。