搜索抓取

孤岛 URL:没有任何内链指向的页面,蜘蛛靠什么发现

站内没有任何链接指向的页面被称为孤岛 URL,它们只能靠 Sitemap、外链或历史记录被发现,抓取频率低、更新也慢。本文说明孤岛页面的常见成因,如何用 Sitemap 清单与站内爬取把无入链的 URL 找出来,以及补入口、补内链、处理无用页面的具体做法。

搜索抓取

孤岛 URL:没有任何内链指向的页面,蜘蛛靠什么发现

什么是孤岛 URL

孤岛 URL,指的是站内没有任何一个可点击链接指向的页面。蜘蛛能发现它的途径只剩下几条:Sitemap 里申报过、站外有链接指向、以前抓过留下了记录,或者它曾经在导航里出现过后来被撤掉了。除此之外,没有别的路可走。

需要分清楚的是,Sitemap 是申报,不是入口。它只告诉蜘蛛“这个地址存在”,不提供这个页面在站内的上下文,也不传递内链上的任何信号。所以 Sitemap 里躺着几百个地址,并不等于这些页面都被正常发现和跟进。

孤岛页面通常是怎么冒出来的

  • 改版时导航和页脚被精简,原来挂在里面的栏目页、专题页失去入口;
  • 商品或内容下架后重新上架,但列表页只展示最新一批,旧地址再没人链;
  • 活动页、落地页临时上线,推广只投站外,站内一个入口都没留;
  • 标签页、作者页、归档页由程序批量生成,却只在 Sitemap 里出现;
  • 列表分页只输出前几页,后面的分页链接由脚本生成,爬取时读不到;
  • 搜索结果页、筛选结果页被保存成静态地址,但没有任何页面链接过去。

它带来的实际问题

孤岛 URL 不等于一定不被收录,问题更多出在“不稳定”三个字上:被发现的时间随机,抓取间隔可能很长,页面改了内容也难以及时同步。即使偶尔被抓到一次,缺少内链意味着站内上下文和权重传递都是断的,蜘蛛不容易判断这个页面在站内处于什么位置、值不值得反复回访。

内链的作用不只是把蜘蛛带过去,还包括告诉它这个页面在站内的位置和相对重要程度。

怎么把孤岛 URL 找出来

  1. 导出 Sitemap 里的全部地址,作为一份待核对清单;
  2. 用站内爬取工具跑一遍全站,记录每个 URL 的入链数量,或者从服务器日志里看哪些地址只被访问过一两次;
  3. 两边对照:只在 Sitemap 里出现、站内入链为 0 的,基本就是孤岛;
  4. 再看这些地址的访问时间分布,如果间隔越来越长甚至不再出现,说明发现路径确实断了。

补入口的几种做法

顺序上优先补站内入口,Sitemap 放在兜底的位置。

  • 面包屑与栏目导航:把页面挂回它原本所属的分类路径,这是最稳的一条路;
  • 相关推荐、最新、热门模块:让同类页面互链,但控制数量,别堆成一个链接农场;
  • 列表页与分页:分页链接用普通 a 标签输出,保证每一页都能顺着点下去;
  • 聚合页:把零散内容按主题汇聚成可遍历的入口页;
  • 正文内的自然引用:在相关内容里加一句指向,比硬塞一个“相关链接”更符合阅读习惯,也更容易被持续点击。

两个可以固定下来的习惯

一是新页面上线时,先确认它从首页出发点几次能点到,点不到的就不算真正上线;二是定期做一次孤岛检查,把新出现的无入链地址补上入口。如果这个页面本来就不需要被搜索抓取,那就用 noindex 或返回 410 明确处理掉,而不是让它在 Sitemap 里悬着。

最后提醒一句:补内链、修分页、整理 Sitemap 都是让发现路径更顺,能减少“地址存在但蜘蛛走不到”的情况,但既不承诺收录,也不承诺排名。