网站收录

孤岛页面与内链深度:页面迟迟不被发现的核对顺序

有些页面没被收录,不是内容问题,而是搜索蜘蛛从没走到过。本文按入口数量、入口页状态、点击深度、链接可抓取性给出核对顺序,并列出无限滚动、首页短暂露出等常见入口问题与可落地的处理动作。

网站收录

孤岛页面与内链深度:页面迟迟不被发现的核对顺序

有些页面并不是被判定为低质量才不收录,而是搜索蜘蛛压根没有走到过那个地址。所以在排查收录之前,先确认一件事:这个页面从首页出发,能不能通过正常链接被点到。如果答案是不能,后面讨论的内容质量、更新频率都属于次要问题。

抓取的前提是有入口

搜索蜘蛛发现 URL 的常见来源包括:站内链接、sitemap、外部链接,以及历史抓取记录里残留的地址。其中站内链接的可控性最强,也最容易被忽略。一个页面如果只存在于 sitemap 里,没有其他页面指向它,它的抓取优先级通常较低,等待时间也会被拉长。

链接本身要可被抓取

  • 链接要写成 a 标签的 href 属性,不要用 onclick 或者 div 模拟跳转;
  • 避免把 JavaScript 渲染后才插入的链接作为唯一入口;
  • 内部链接不要加 rel="nofollow",也不要用 robots.txt 屏蔽列表页;
  • 锚文本尽量有实际含义,避免整页都是“点击这里”。

核对顺序

  1. 先确认页面有几个内链入口。只有 sitemap 里出现、正文中没有任何链接指向的地址,通常属于孤岛页面。处理方式是把它接回主结构,而不是反复提交。
  2. 再看入口页自己有没有被抓取。如果指向目标页的栏目页或列表页长期没被抓,目标页自然难以被发现。入口失效会连锁传递。
  3. 检查点击深度。从首页到目标页要经过几层链接?层级越深,被抓取的频次和优先级通常越低。重要页面尽量控制在三层以内。
  4. 检查列表页的分页与筛选。如果新页面只出现在第十页之后,或者只在某个筛选参数组合里出现,被发现的概率会明显下降,可以把重要入口前置。
  5. 检查入口链接是否指向跳转或屏蔽地址。入口先跳 301 再跳目标页,链路越长,发现效率越低。
  6. 最后才看内容与更新。入口确认存在、层级合理、链接可抓取之后,再去讨论内容差异度和更新信号,顺序不要颠倒。

常见的几种入口问题

  • 栏目页用无限滚动,链接只在滚动后才生成,蜘蛛看到的是空容器;
  • 新文章只在首页短暂露出,第二天就被推到列表深处;
  • 标签页、聚合页数量很多,真正的内容页却没有反向链接;
  • 把站内搜索结果页当成入口,实际是参数型临时地址。
把页面接进主链接结构,是提高被发现概率的常规做法,但它不等于一定被收录。是否进入索引,仍由搜索引擎综合判断。

可以落地的处理动作

先做一次小范围盘点:从首页出发按点击层级顺一遍站内链接,找出没有任何页面链接到的地址。针对这些地址,选择相关的栏目页或文章页做自然的上下文链接,而不是在页脚全站堆链接。对于确实需要长期保留、但入口偏弱的页面,可以考虑在相关聚合页或导航中给出固定位置。

处理完之后不要立刻反复提交,给抓取和评估留一段时间,再观察入口页与目标页的抓取记录是否出现变化。如果入口已经接好、层级也合理,剩下的就更偏向内容本身和整体站点质量了。