什么是孤岛页面
孤岛页面指的是站点里缺少有效内链入口的页面。它可能存在于服务器上,也可能被 Sitemap 列出,但蜘蛛在正常抓取路径中很难顺着链接走到它。对蜘蛛来说,一个 URL 被写在 Sitemap 里,只代表它有机会被发现,不代表它会被顺利抓取。如果站内没有可抓取的链接指向它,抓取优先级和重访频率通常都会偏低。
蜘蛛发现 URL 的几条路径
蜘蛛发现 URL 主要靠几条路:外部链接、站内链接、Sitemap、提交接口,以及历史抓取记录。其中内链是最稳定的发现路径,因为蜘蛛会沿着页面上的可抓取链接不断扩展抓取范围。外链和提交接口能带来初始发现,但页面要持续被重访,通常还是需要站内链接把它接进整体结构中。
孤岛页面常见的几种成因
- 页面只通过 JavaScript 动态插入链接,且链接不是标准 a 标签,蜘蛛无法顺着点击事件走。
- 链接被 nofollow、robots 或 meta 规则挡住,蜘蛛能看到链接但不会继续抓取。
- 页面藏在筛选、分页或参数组合后面,入口很深,链接路径容易断掉。
- 新页面发布后没有从任何已有页面链接过去,只提交了 URL。
- 内链只放在页脚或侧栏,且全站重复,蜘蛛不一定会把它当作重要入口。
- Sitemap 有记录,但站内长期没有入口链接,页面逐渐变成孤岛。
怎么排查孤岛页面
可以先从日志和抓取工具入手,按顺序核对:
- 用日志分析工具,看目标 URL 是否有蜘蛛访问记录,以及访问频率是否明显低于同层级页面。
- 用站点爬虫模拟抓取,查看从首页出发能走到哪些页面,哪些页面不在路径内。
- 检查内链报告,看页面的入链数量和来源页面,判断它是否只依赖 Sitemap 或提交接口。
- 核对 Sitemap 与实际内链是否一致,找出“已列出但无入口”的页面。
如果某个页面在 Sitemap 里,但站内没有任何可抓取入口链接,它就很可能是孤岛页面。此时不要急着反复提交 URL,先检查内链结构。
把孤岛页面接回抓取路径
修复思路是给它增加稳定的内链入口,让蜘蛛能沿着已有路径走到:
- 从相关频道页、列表页或聚合页添加入口链接,优先放在离首页较近的层级。
- 在正文中做上下文内链,链接到相关页面,让链接位置和内容主题相关。
- 用面包屑或标签页串联同主题页面,减少页面之间的跳转断层。
- 如果同类页面较多,可以做一个索引页,集中列出入口,再由索引页链接到详情页。
- 确保链接是可抓取的 a 标签,避免依赖按钮、表单或纯 JS 跳转。
Sitemap 可以作为辅助发现通道,但不要把它当成唯一入口。蜘蛛更倾向于沿着站内链接逐步抓取,内链稳定的页面通常更容易被持续访问。
注意事项
增加内链时,要控制数量和质量,避免为了抓取而堆砌链接。链接应该对用户也有帮助,否则可能影响页面体验。
另外,如果服务器不稳定,蜘蛛即使走到入口,也可能因为超时或错误反复中断。保持响应稳定、减少 5xx 和连接失败,有助于提高抓取完成度。对于重要页面,建议同时检查移动端和桌面端的链接是否都能正常呈现。
孤岛页面的修复不是一次性的。站点结构、栏目和内容都会变化,定期用日志和爬虫工具核对抓取路径,才能及时发现新的孤岛页面,并把它重新接回可抓取的链接网络。