什么是孤岛頁面
孤岛頁面,指的是那些没有站内連結指向、只能通過 Sitemap、外部連結或手動提交才能被發現的 URL。它們不是打不開的頁面,但在蜘蛛的連結图里,入鏈為零,抓取路径很难延伸到那里。
孤岛頁面是怎么出現的
- 改版或栏目調整时,入口連結被删掉,頁面本身還保留着。
- 新頁面只通過 JavaScript 跳轉或表單按钮到達,没有可抓取的 a 标簽。
- 篩選、分頁或參數生成的頁面,没有被任何列表頁連結引用。
- Sitemap 里提交了 URL,但站内没有對應的入口連結。
- 站内搜尋、标簽頁或归档頁没有把詳情頁串起来。
蜘蛛為什么绕不過去
搜尋蜘蛛主要沿着連結爬行。一個 URL 如果没有入鏈,即使出現在 Sitemap 中,通常也只是進入候選池,抓取優先級和回訪频率都可能偏低。蜘蛛不會主動猜测路径,它需要一條可走通的連結路线。
孤岛頁面不是蜘蛛“不喜欢”,而是蜘蛛根本没有路径走到它。
怎么發現孤岛頁面
- 把 Sitemap 中的 URL 與服務器日誌里蜘蛛實际訪問的 URL 做對比,找出長期没有抓取记錄的頁面。
- 用站内爬虫工具抓取全站,检查哪些 URL 只能通過 Sitemap 發現、没有内鏈入口。
- 查看站長平台中“已發現但未抓取”或“已提交未索引”的列表,结合内鏈情况判断。
- 梳理連結图,找入度為 0 的頁面。入度為零,基本就是孤岛。
修复思路
- 在相關栏目、文章正文或聚合頁中,用 HTML 連結為孤岛頁面添加入口。
- 把 JS 跳轉改成可抓取的 a 标簽,或至少保留一個静態連結。
- 如果頁面已经無價值,用 301 或 410 做收敛,不要让無效 URL 繼續占位。
- Sitemap 只保留希望被抓取的 URL,不要塞入大量低质或重复頁面。
- 定期检查内鏈图,尤其是改版、下架专题和調整目錄之後。
小结
孤岛頁面往往不是技術故障,而是連結维護的疏漏。用日誌核對抓取记錄,用内鏈图找出没有入鏈的 URL,再决定补充入口還是收敛刪除。保持連結结构清晰,蜘蛛的抓取路径才會更顺畅。