什么是孤岛頁面
孤岛頁面指的是能從站点内部連結图中被發現的入口极少、甚至没有的 URL。它可能内容完整、返回 200、也能正常打開,但從首頁出發沿着任何一條内鏈路径都走不到它。對蜘蛛来说,這類 URL 只能依赖站点地图、外部連結或歷史记錄被動發現,抓取優先級和回爬频率通常都不理想。
這里要区分两件事:URL 能不能被打開,和 URL 能不能被找到。前者属于服務器與解析問题,後者属于連結结构問题。孤岛頁面属于第二類。
孤岛頁面常见的形成原因
- 栏目改版後舊導航入口被移除,頁面本身還保留着。
- 活動頁或专题頁上线时挂在首頁,下线後只剩 URL 可直接訪問。
- 只在搜尋结果頁、篩選结果頁出現的 URL,缺少固定連結入口。
- 文章之間的關联推荐形成閉环,但没有任何一個入口指向這批頁面。
- 只在 Sitemap 中列出,站内没有任何連結指向。
- 連結由 JavaScript 拼接生成,預設狀態下不渲染。
蜘蛛還有哪几條路能發現這些 URL
没有内鏈不等于完全看不到,只是通道變少、效率變低。常见的通道有:
- Sitemap:對孤岛頁面来说是主要的保底通道,它的作用是帮助發現,並不代表頁面會立刻被抓取。
- 外部連結:其他站点指向该 URL 时,蜘蛛仍可能顺着外鏈進来。
- 歷史抓取记錄:之前抓過的 URL 會留在队列里,改版後仍可能被回爬。
- 站内搜尋、标簽頁、分頁等次要入口:如果這些入口本身能被抓到,也能带出部分 URL。
這些通道的共同問题是:缺少稳定的内鏈支撑时,蜘蛛拿不到足够的信号来判断這個 URL 值不值得爬。
怎么找出站内的孤岛
排查思路是把两份清單對照:一份是站内已知的 URL 全集,一份是被内鏈引用到的 URL 集合,两者相减,差值就是候選孤岛。
- 以 Sitemap 或資料库導出的 URL 作為全集。
- 通過站点抓取或日誌分析,整理出被内鏈引用到的 URL。
- 两者比對,重点看長期没有内鏈入口、日誌里却只有零星抓取的頁面。
- 结合抓取日誌看回爬間隔,孤岛頁面的回爬通常更稀疏、更不稳定。
處理方式
- 能补連結就补連結。在相關性强的栏目、正文或推荐模块里加一條自然入口,比放在頁脚批量堆連結更有效。
- 给栏目做一個稳定入口。列表頁、标簽頁、归档頁只要本身能被抓取,就能带出一批深层 URL。
- Sitemap 兜底。對确實無法加内鏈的頁面,保證它出現在 Sitemap 中,並與站内狀態保持一致。
- 合並或下线。如果頁面已经没有價值,用 301 指向相近的有效頁面,比让它長期孤立更清晰。
内鏈既给出路径,也给出權重和優先級的线索。孤岛頁面缺的往往不是内容,而是這條路径。
別走另一個极端
為了消灭孤岛而在頁脚、侧栏批量堆連結,會让連結图變得杂乱,蜘蛛反而分不清哪些是重点。更合适的做法是控制數量、保證相關性,让入口出現在用戶也會用到的地方。
小结
把孤岛頁面当成連結结构問题来處理,而不是内容問题:先找出来,再补一條真正有用的路径,最後用 Sitemap 兜底。這個過程不會立刻改變抓取结果,但能让站点的 URL 發現更稳定,也更少依赖偶然的外鏈。