什么是孤岛页面
孤岛页面,指的是那些没有站内链接指向、只能通过 Sitemap、外部链接或手动提交才能被发现的 URL。它们不是打不开的页面,但在蜘蛛的链接图里,入链为零,抓取路径很难延伸到那里。
孤岛页面是怎么出现的
- 改版或栏目调整时,入口链接被删掉,页面本身还保留着。
- 新页面只通过 JavaScript 跳转或表单按钮到达,没有可抓取的 a 标签。
- 筛选、分页或参数生成的页面,没有被任何列表页链接引用。
- Sitemap 里提交了 URL,但站内没有对应的入口链接。
- 站内搜索、标签页或归档页没有把详情页串起来。
蜘蛛为什么绕不过去
搜索蜘蛛主要沿着链接爬行。一个 URL 如果没有入链,即使出现在 Sitemap 中,通常也只是进入候选池,抓取优先级和回访频率都可能偏低。蜘蛛不会主动猜测路径,它需要一条可走通的链接路线。
孤岛页面不是蜘蛛“不喜欢”,而是蜘蛛根本没有路径走到它。
怎么发现孤岛页面
- 把 Sitemap 中的 URL 与服务器日志里蜘蛛实际访问的 URL 做对比,找出长期没有抓取记录的页面。
- 用站内爬虫工具抓取全站,检查哪些 URL 只能通过 Sitemap 发现、没有内链入口。
- 查看站长平台中“已发现但未抓取”或“已提交未索引”的列表,结合内链情况判断。
- 梳理链接图,找入度为 0 的页面。入度为零,基本就是孤岛。
修复思路
- 在相关栏目、文章正文或聚合页中,用 HTML 链接为孤岛页面添加入口。
- 把 JS 跳转改成可抓取的 a 标签,或至少保留一个静态链接。
- 如果页面已经无价值,用 301 或 410 做收敛,不要让无效 URL 继续占位。
- Sitemap 只保留希望被抓取的 URL,不要塞入大量低质或重复页面。
- 定期检查内链图,尤其是改版、下架专题和调整目录之后。
小结
孤岛页面往往不是技术故障,而是链接维护的疏漏。用日志核对抓取记录,用内链图找出没有入链的 URL,再决定补充入口还是收敛删除。保持链接结构清晰,蜘蛛的抓取路径才会更顺畅。