什么是孤岛頁面
孤岛頁面指的是站内没有任何連結指向它的頁面。它存在于資料库里,可能也在 sitemap 里,但用戶從首頁出發点不到它,蜘蛛也只能靠 sitemap 或者某個外部連結偶然撞见。這類頁面打開是正常的,不报错、不返回異常狀態碼,所以最容易被忽略。
孤岛頁面是怎么产生的
- 先發文章、後做栏目,文章發完一直没被挂進任何列表。
- 栏目改版、合並或下线,入口撤掉了,舊文章還留在线上。
- 只做了标簽頁或专题聚合頁,但聚合頁自己也没有入口。
- 分頁列表只保留第一頁的連結,後面的頁只能靠“下一頁”按钮一頁頁点。
- 文章只在站内搜尋结果里能查到,而搜尋頁本身不允许抓取。
- 活動頁、专题頁上线时挂在首頁,活動結束後入口被撤掉。
為什么值得花時間處理
蜘蛛發現新 URL 主要靠連結。孤岛頁面等于把發現權交给了 sitemap 和运气。带来的後果通常有几個:收錄慢、内容更新後蜘蛛不知道、外部連結的權重無法通過站内路径传递下去、日誌里長期看不到抓取记錄。
它不會报错,所以更需要主動查
404 和 5xx 會提醒你出問题了,孤岛頁面不會。頁面能打開,站長平台里可能顯示“已發現,尚未编入索引”,然後就一直没有下文。想發現問题,只能主動比對連結關系。
怎么把孤岛頁面找出来
- 用爬取工具抓一遍全站,導出所有連結指向的目标 URL,去重後得到集合 A。
- 從 sitemap 或 CMS 内容库導出全部可訪問頁面,得到集合 B。
- B 减去 A 的差集,就是站内没有入口的頁面,先從這里面挑優先處理的。
- 對照服務器日誌,把長期没有蜘蛛訪問记錄、站内引荐流量也為零的頁面挑出来。
- 看站長平台里的“已發現但未编入索引”“已抓取未编入索引”列表,作為交叉驗證。
爬取工具看到的是連結图,日誌看到的是實际抓取。两者對照,孤岛頁面基本無處可藏。
修复思路:给每個内容一條稳定入口
- 父栏目入口:每篇文章至少能從一個栏目列表、专题頁或归档頁点進去,面包屑和栏目路径保持一致。
- 相關阅讀與上下篇:同主题内容互相連結,比堆全站热榜更有效,也更容易長期维護。
- 分頁路径要完整:列表翻到最後一頁都有可達連結,別让舊内容只能靠一頁頁点“下一頁”才能到達。
- 聚合頁要有门槛:标簽頁、专题頁内容不够就先別自動生成,避免用一批空壳頁面去“消灭”孤岛。
- 別把站内搜尋结果当入口:搜尋頁通常不宜抓取,新文章不能只在那里出現。
- sitemap 是兜底,不是替代:它帮助發現 URL,但既传递不了内鏈關系,也說明不了内容之間的關联。
把它變成上线流程的一部分
内容發布时顺手確認三件事:這條内容挂在哪個栏目、和哪几篇同主题内容互鏈、列表頁里有没有它。改版或下线栏目时,先查一遍该栏目下所有頁面的去向,能合並的做 301,不能合並的补新入口或明确下线。每隔一段時間跑一次全站爬取,把差集当成待办清單,而不是一次性的集中清理。
最後提醒一句:不要為了清零孤岛頁面,往不相關的地方硬塞連結。入口要和内容主题相關,否則只是把孤岛變成了噪声。