什么是孤岛页面
孤岛页面指的是能从站点内部链接图中被发现的入口极少、甚至没有的 URL。它可能内容完整、返回 200、也能正常打开,但从首页出发沿着任何一条内链路径都走不到它。对蜘蛛来说,这类 URL 只能依赖站点地图、外部链接或历史记录被动发现,抓取优先级和回爬频率通常都不理想。
这里要区分两件事:URL 能不能被打开,和 URL 能不能被找到。前者属于服务器与解析问题,后者属于链接结构问题。孤岛页面属于第二类。
孤岛页面常见的形成原因
- 栏目改版后旧导航入口被移除,页面本身还保留着。
- 活动页或专题页上线时挂在首页,下线后只剩 URL 可直接访问。
- 只在搜索结果页、筛选结果页出现的 URL,缺少固定链接入口。
- 文章之间的关联推荐形成闭环,但没有任何一个入口指向这批页面。
- 只在 Sitemap 中列出,站内没有任何链接指向。
- 链接由 JavaScript 拼接生成,默认状态下不渲染。
蜘蛛还有哪几条路能发现这些 URL
没有内链不等于完全看不到,只是通道变少、效率变低。常见的通道有:
- Sitemap:对孤岛页面来说是主要的保底通道,它的作用是帮助发现,并不代表页面会立刻被抓取。
- 外部链接:其他站点指向该 URL 时,蜘蛛仍可能顺着外链进来。
- 历史抓取记录:之前抓过的 URL 会留在队列里,改版后仍可能被回爬。
- 站内搜索、标签页、分页等次要入口:如果这些入口本身能被抓到,也能带出部分 URL。
这些通道的共同问题是:缺少稳定的内链支撑时,蜘蛛拿不到足够的信号来判断这个 URL 值不值得爬。
怎么找出站内的孤岛
排查思路是把两份清单对照:一份是站内已知的 URL 全集,一份是被内链引用到的 URL 集合,两者相减,差值就是候选孤岛。
- 以 Sitemap 或数据库导出的 URL 作为全集。
- 通过站点抓取或日志分析,整理出被内链引用到的 URL。
- 两者比对,重点看长期没有内链入口、日志里却只有零星抓取的页面。
- 结合抓取日志看回爬间隔,孤岛页面的回爬通常更稀疏、更不稳定。
处理方式
- 能补链接就补链接。在相关性强的栏目、正文或推荐模块里加一条自然入口,比放在页脚批量堆链接更有效。
- 给栏目做一个稳定入口。列表页、标签页、归档页只要本身能被抓取,就能带出一批深层 URL。
- Sitemap 兜底。对确实无法加内链的页面,保证它出现在 Sitemap 中,并与站内状态保持一致。
- 合并或下线。如果页面已经没有价值,用 301 指向相近的有效页面,比让它长期孤立更清晰。
内链既给出路径,也给出权重和优先级的线索。孤岛页面缺的往往不是内容,而是这条路径。
别走另一个极端
为了消灭孤岛而在页脚、侧栏批量堆链接,会让链接图变得杂乱,蜘蛛反而分不清哪些是重点。更合适的做法是控制数量、保证相关性,让入口出现在用户也会用到的地方。
小结
把孤岛页面当成链接结构问题来处理,而不是内容问题:先找出来,再补一条真正有用的路径,最后用 Sitemap 兜底。这个过程不会立刻改变抓取结果,但能让站点的 URL 发现更稳定,也更少依赖偶然的外链。