搜索抓取

蜘蛛走不到的页面:孤岛 URL 的成因、检测与补救

孤岛页面没有内链指向,也不在站内外链与 Sitemap 的覆盖范围内,蜘蛛很难通过链接图发现。本文梳理孤岛 URL 的常见成因,给出从日志、Sitemap 和站内爬行入手的检测方法,并整理补内链、加导航、更新 Sitemap 等可落地的补救步骤,同时提醒不要用全站堆链接的方式硬拉。

搜索抓取

蜘蛛走不到的页面:孤岛 URL 的成因、检测与补救

什么是孤岛页面

孤岛页面通常指没有站内链接指向的页面。它可能能直接打开,也可能存在于服务器上,但在站点的链接图里找不到一条从首页或其他已抓取页面通向它的路径。蜘蛛发现 URL 主要靠顺着链接走,其次是 Sitemap 和主动提交。一个页面如果这三条路都断了,被发现的概率就会明显下降。

孤岛页面常见的几种成因

  • 改版时删了栏目,页面却保留:旧列表页下线,详情页还在,链接入口一起消失。
  • 详情页只靠站内搜索到达:搜索结果是动态生成,蜘蛛通常不会把搜索框当成稳定入口。
  • 分页太深:列表只显示前几页,后面的页面没有“下一页”或分段链接。
  • 标签、归档页没有入口:这些聚合页本身没有被导航或文章内链引用。
  • Sitemap 没有更新:新页面生成后未写入 Sitemap,旧页面也没做跳转或下线处理。

怎么找出这些页面

第一步是拿现有页面清单和链接图做对比。可以从 Sitemap、数据库或后台导出全部 URL,再用站内爬行工具从首页出发抓一遍,看哪些 URL 没有出现在任何内链中。

第二步看访问日志。如果某个 URL 长期只有你自己或少数用户访问,蜘蛛的 User-Agent 几乎没有出现,说明它没有被稳定发现。日志里还能看到蜘蛛真正走过的路径,比单纯看目录结构更接近实际。

第三步检查 Sitemap 与 robots.txt。Sitemap 里写了但站内没有链接,蜘蛛仍可能抓到,但抓取频率和重访往往不如有内链的页面稳定。如果 robots.txt 误屏蔽了某个目录,那就不只是孤岛,而是主动拦截。

补救时的几个动作

  1. 补一条就近的内链:在相关文章、栏目页或专题页里加入指向孤岛页面的链接,锚文本要能说明目标页主题。
  2. 恢复面包屑与上级入口:让页面回到栏目层级中,而不是只靠 URL 直接访问。
  3. 给列表页加分段或“查看更多”:如果历史内容很多,至少让前若干页能走到后面的分页。
  4. 更新 Sitemap:把确认要保留的页面写入,并保持 lastmod 与真实更新时间一致。
  5. 用相关推荐、热门内容、标签聚合补充入口:注意控制数量,避免每页堆上百条链接。
补内链不是越多越好。一个页面被几十个不相关的链接同时指向,蜘蛛会重新判断它的位置和重要性;更稳妥的做法是从主题相关的页面逐步加入。

加完链接后怎么观察

补链接之后,不要马上认为问题解决了。先观察日志中该 URL 的抓取次数是否增加,再看蜘蛛是否开始沿着新入口访问同一批页面。如果只有 Sitemap 提交、没有内链,蜘蛛可能只来一次;内链稳定后,重访才会更规律。

对于确实不需要保留的孤岛页面,更合适的处理是 301 到相关页面,或返回 410 明确下线,而不是让它继续留在服务器上被偶然发现。站点越大,越需要定期做一次链接图清理,把新增页面和失效页面都纳入检查范围。