搜索抓取

孤岛页面:蜘蛛找不到的那些 URL 是怎么形成的

孤岛页面指那些没有内链指向、只能靠 Sitemap 或外部链接被发现的 URL。它们未必是坏页面,却容易让蜘蛛在抓取路径上绕开。本文从成因、检测和修复三个角度,说明如何用日志与内链图找出孤岛页面,并让有价值的 URL 重新回到抓取路径中。

搜索抓取

孤岛页面:蜘蛛找不到的那些 URL 是怎么形成的

什么是孤岛页面

孤岛页面,指的是那些没有站内链接指向、只能通过 Sitemap、外部链接或手动提交才能被发现的 URL。它们不是打不开的页面,但在蜘蛛的链接图里,入链为零,抓取路径很难延伸到那里。

孤岛页面是怎么出现的

  • 改版或栏目调整时,入口链接被删掉,页面本身还保留着。
  • 新页面只通过 JavaScript 跳转或表单按钮到达,没有可抓取的 a 标签。
  • 筛选、分页或参数生成的页面,没有被任何列表页链接引用。
  • Sitemap 里提交了 URL,但站内没有对应的入口链接。
  • 站内搜索、标签页或归档页没有把详情页串起来。

蜘蛛为什么绕不过去

搜索蜘蛛主要沿着链接爬行。一个 URL 如果没有入链,即使出现在 Sitemap 中,通常也只是进入候选池,抓取优先级和回访频率都可能偏低。蜘蛛不会主动猜测路径,它需要一条可走通的链接路线。

孤岛页面不是蜘蛛“不喜欢”,而是蜘蛛根本没有路径走到它。

怎么发现孤岛页面

  1. 把 Sitemap 中的 URL 与服务器日志里蜘蛛实际访问的 URL 做对比,找出长期没有抓取记录的页面。
  2. 用站内爬虫工具抓取全站,检查哪些 URL 只能通过 Sitemap 发现、没有内链入口。
  3. 查看站长平台中“已发现但未抓取”或“已提交未索引”的列表,结合内链情况判断。
  4. 梳理链接图,找入度为 0 的页面。入度为零,基本就是孤岛。

修复思路

  • 在相关栏目、文章正文或聚合页中,用 HTML 链接为孤岛页面添加入口。
  • 把 JS 跳转改成可抓取的 a 标签,或至少保留一个静态链接。
  • 如果页面已经无价值,用 301 或 410 做收敛,不要让无效 URL 继续占位。
  • Sitemap 只保留希望被抓取的 URL,不要塞入大量低质或重复页面。
  • 定期检查内链图,尤其是改版、下架专题和调整目录之后。

小结

孤岛页面往往不是技术故障,而是链接维护的疏漏。用日志核对抓取记录,用内链图找出没有入链的 URL,再决定补充入口还是收敛删除。保持链接结构清晰,蜘蛛的抓取路径才会更顺畅。