孤岛页面,指站内没有任何链接指向的 URL。它可以正常打开、返回 200,但蜘蛛沿着链接爬行时永远走不到它。这类页面在改版遗留、活动页下线、CMS 批量生成的参数页里很常见。要处理它,先要知道蜘蛛平时是从哪些入口拿到新 URL 的。
蜘蛛发现 URL 的几条常见路径
- 站内链接:首页、栏目页、详情页里的 a 标签,是最主要也最稳定的发现渠道。
- Sitemap:适合成批提交,但它更像一份候选清单,清单里的 URL 未必都会被立刻访问。
- 外部链接:别的站点指向你的链接,是蜘蛛找到新站、新栏目常走的一条路。
- 主动提交:各搜索平台的提交入口或 API,适合新页面和时效性内容。
- 日志回流:服务器日志能看出蜘蛛实际访问了哪些路径,反过来帮你判断哪些 URL 从没被发现过。
孤岛页面通常是怎么形成的
- 改版时栏目结构换了,旧路径还留在服务器上,新导航已经不再指向它。
- 列表页只展示“最新的 N 条”,历史内容被挤出列表,又没有归档页接手。
- 页面由模板批量生成,彼此之间没有交叉链接,只靠一个总入口。
- 筛选、排序、会话参数组合出的 URL,只在特定操作下才出现。
- 页面需要登录或依赖 JavaScript 交互才能触达,蜘蛛拿不到那条链接。
Sitemap 能救孤岛页吗
Sitemap 是补充,不是替代。它可以告诉蜘蛛“这些 URL 存在”,但抓不抓、什么时候抓,仍取决于服务器状态、页面本身的价值和站点整体的抓取节奏。如果一个 URL 长期没有任何内链、外链,内容又和站内其他页面高度重复,即便写进 Sitemap,也容易排在抓取队列的后面。更稳妥的做法是:Sitemap 保持干净准确,同时给重要页面补上真实的内链入口。
把孤岛页找出来的自检方法
- 导出服务器日志中蜘蛛访问过的 URL 列表。
- 用站内爬虫工具抓一遍全站,导出所有能通过链接到达的 URL。
- 把站点实际的 URL 清单(从数据库、CMS 或 Sitemap 导出)与上面两份列表做差集。
- 差集里那些既没有内链、日志中也从未出现过的,就是需要优先确认的孤岛页。
给孤岛页补入口的几种做法
- 在相关文章、相关产品、标签页里加入指向它的链接,链接要有实际语境。
- 建立归档页或索引页,把被列表页挤出去的历史内容重新收进来。
- 做一个 HTML 版本的站点地图页,放在页脚这类容易到达的位置。
- 用面包屑把页面挂回栏目层级,让蜘蛛知道它属于哪里。
- 新页面出现后,通过提交入口推送一次,缩短等待时间。
哪些页面不值得补链
并不是所有孤岛页都要救。过期活动页、内容已被合并的重复页、纯参数组合出来的空结果页,更合适的处理是 404、410 或做 301 指向新页面,而不是硬塞进导航。判断标准可以简单一点:这个页面如果有真实用户通过搜索进来,内容是否还站得住?站不住就清理,站得住再考虑入口。
补上入口只是第一步。补完之后仍要用日志观察一段时间,确认蜘蛛确实顺着新入口走到了这些 URL,而不是只看提交结果就当作已经完成。