搜索抓取

孤岛页面:URL 提交了,为什么蜘蛛还是很少走进去

网站里常有一类页面:地址能打开,Sitemap 里也列着,但从首页和其他内容页都没有链接指向它。这类孤岛页面不是完全不被抓,而是缺少持续路径,抓取频次和回访间隔往往不理想。本文讲蜘蛛如何发现孤岛 URL,以及怎样用内链、聚合页和 Sitemap 把它们接回抓取路径。

搜索抓取

孤岛页面:URL 提交了,为什么蜘蛛还是很少走进去

站点里经常有这类页面:URL 能正常访问,Sitemap 里也写了,但从首页、栏目页和其他内容页都找不到一条链接指向它。它们不是打不开,也不是被 robots.txt 拦住,只是没有一条持续的内链路径。这类页面可以叫孤岛页面。

孤岛页面是怎么出现的

常见来源有几类:早期发布后改版删掉了入口;活动页下线但地址保留;商品 SKU 或文章详情只靠站内搜索才能到达;分页、筛选组合生成的深层 URL 没有被任何列表页引用。它们往往有内容,也有标题,但蜘蛛从首页一路走下来时,走不到它们。

蜘蛛发现 URL 的几种方式

蜘蛛拿到一个 URL,不等于会马上、频繁地抓它。常见发现路径包括:

  • Sitemap:能一次性提交大量地址,但只是“候选清单”,不保证抓取顺序和频次。
  • 外链:从其他站点指向孤岛页,蜘蛛可能顺着外链进来,但外链不稳定,页面本身缺少站内入口。
  • 提交入口:适合新 URL 或更新通知,有时效性,不适合长期替代内链。
  • 内链:蜘蛛在站内持续行走的主要路径,也是最稳定的发现方式。

所以,孤岛页面通常不是完全不被抓,而是排得比较靠后。它需要蜘蛛“额外想起来”才会被访问,回访间隔也可能拉长。

从日志里看孤岛页面的抓取表现

如果你观察服务器日志,常会看到这些现象:孤岛 URL 的抓取次数明显少于同层级有内链的页面;回访间隔不稳定,有时几周才来一次;蜘蛛在首页和热门栏目页反复走,却很少穿过某个断层进入孤岛区域。这不一定是服务器慢,也不一定是内容差,而是缺少一条让它顺路走进去的路径。

没有内链的页面,蜘蛛需要额外理由才会走进去;Sitemap 能提交地址,但替代不了站内路径。

把孤岛页面接回抓取路径

  1. 从相关主题页加正文内链。找到与孤岛页主题最接近的文章或栏目,在正文中自然插入链接。位置比数量重要,放在相关段落里,蜘蛛和用户都更容易理解。
  2. 用聚合页或栏目页做二级入口。如果孤岛页数量多,可以按主题、时间或类型做列表页,让它们从首页经两三层内链可达。
  3. 检查分页和筛选路径。深层页不要只靠参数组合被发现。关键内容尽量有静态列表入口,避免蜘蛛走到一半没有可跟的链接。
  4. Sitemap 保底,但保持字段真实。把孤岛 URL 放进 Sitemap 有价值,尤其是新页面。lastmod 要反映真实更新,不要每次生成都改时间。
  5. 提交入口只做补充。新 URL 或重要更新可以提交,但长期抓取仍要依赖内链和站点结构。

内链不是越多越好

把孤岛页面接回来后,不必在同一页面堆大量链接。更实用的做法是:同一主题下选几个最相关的页面互相链接;在列表页保持稳定入口;避免用“相关推荐”一次性塞几十个不相关的 URL。蜘蛛会沿着链接走,但也会判断链接上下文和页面相关性。

日常检查可以看什么

  • 用站点爬虫只按内链走一遍,看哪些 URL 无法从首页到达。
  • 在日志中对比有内链页面与孤岛页面的抓取次数、回访间隔。
  • 核对 Sitemap 中的 URL 与内链覆盖范围,找出长期只靠 Sitemap 的页面。
  • 改版、下线栏目或调整分页后,重新检查一遍入口是否还在。

孤岛页面的问题,通常不是“蜘蛛不认识这个 URL”,而是“蜘蛛没有一条顺路的理由走过去”。把内链、聚合页和 Sitemap 配合起来,页面才有机会回到正常的抓取节奏里。