搜索抓取

孤岛页面与 URL 发现:只有 Sitemap 提到、没有内链入口的页面会怎样

有些 URL 在 Sitemap 里写得清清楚楚,服务器日志里却几乎看不到蜘蛛来访,它们多半是没有入链的孤岛页面。本文说明孤岛页是怎么产生的、Sitemap 在其中能起多大作用,以及怎样用内链把页面重新接回站点结构,并给出验证方法和大小站的处理差异。

搜索抓取

孤岛页面与 URL 发现:只有 Sitemap 提到、没有内链入口的页面会怎样

很多站点整理 URL 清单时,会撞上一个尴尬的现象:某些页面在 Sitemap 里明明写着,服务器日志里却几乎看不到蜘蛛来访。它们既没被 robots.txt 挡住,也没有返回错误码,只是站内没有任何一个可抓取页面链过去——也就是常说的“孤岛页面”。

孤岛页面是怎么出现的

孤岛页很少是故意造成的,多数来自日常操作:

  • 专题或活动页做完之后,入口从首页撤下,页面本身还挂着;
  • 程序批量生成的分页、筛选结果页,没有上级列表链接;
  • 旧路径迁到新路径,旧内链删了,新页面没接回去;
  • 只在 sitemap.xml、站内搜索或后台文章列表里能看到,前台没有可达路径。

从爬虫的视角看,站点结构是被链接“连”出来的。没有入链,就等于没有路。

Sitemap 是线索,不是入场券

把 URL 写进 Sitemap,作用主要是告诉搜索引擎“这里有一份地址清单”。它解决的是“知不知道”的问题,不解决“值不值得抓、抓了怎么理解”的问题。蜘蛛拿到清单之后仍要排抓取队列,参考站点整体质量、历史抓取反馈、页面更新频率等因素。一个既有站内入链、又被外部引用的页面,和一个只在 Sitemap 里出现过一次的页面,被安排的优先级通常不在一个量级上。

Sitemap 更像地图上的标记点;能不能走过去,取决于路上有没有桥。

给孤岛页接一条路

想让这类页面被稳定发现,思路是把它们放回站内结构里,而不是反复提交地址清单。

  1. 找到最近的同类聚合页。文章归栏目、商品归分类、活动页归专题,优先出现在语义相关的列表里。
  2. 链接位置比链接数量重要。一处正文内的上下文链接,通常比页脚几十条通用链接更能帮蜘蛛判断相关性。
  3. 控制入口数量。不要把同一批页面在首页、侧栏、页脚全部铺开,这会把抓取预算摊薄。
  4. 保持路径稳定。接好内链后不要频繁改位置,蜘蛛需要几轮抓取才能重新梳理结构。

怎么确认一个页面是不是孤岛

  • 用站内链接检查工具或爬取工具,看有多少可达页面指向它;
  • 翻服务器日志,看它最近一次被访问的时间与来源路径;
  • 确认它是否只出现在 Sitemap、后台列表或站内搜索结果里;
  • 检查是否有 nofollow、robots meta,或链接依赖脚本渲染而实际不可见。

需要分清的是,这里讨论的是“能不能被发现”,不是“会不会被收录”。抓取、索引、排名是三件事,修好内链只解决第一环,后面还要看内容本身是否值得留下。

小站和大站的差别

小站页面少,孤岛页往往一两轮抓取就被顺带发现;大站页面多,抓取预算被摊得很薄,孤岛页可能长期停在清单里。所以大站更该定期做链接盘点,把入口集中到真正重要的页面上,对不再维护的孤岛页明确态度——要么接回结构,要么用 301、noindex 做出取舍。

把孤岛问题当成一次结构清理的契机,通常比反复提交地址清单更有效:蜘蛛看见的,始终是链接搭出来的那座站。