什么是孤岛頁面
孤岛頁面指的是站点里缺少有效内鏈入口的頁面。它可能存在于服務器上,也可能被 Sitemap 列出,但蜘蛛在正常抓取路径中很难顺着連結走到它。對蜘蛛来说,一個 URL 被寫在 Sitemap 里,只代表它有机會被發現,不代表它會被顺利抓取。如果站内没有可抓取的連結指向它,抓取優先級和重訪频率通常都會偏低。
蜘蛛發現 URL 的几條路径
蜘蛛發現 URL 主要靠几條路:外部連結、站内連結、Sitemap、提交接口,以及歷史抓取记錄。其中内鏈是最稳定的發現路径,因為蜘蛛會沿着頁面上的可抓取連結不断扩展抓取范围。外鏈和提交接口能带来初始發現,但頁面要持續被重訪,通常還是需要站内連結把它接進整体结构中。
孤岛頁面常见的几種成因
- 頁面只通過 JavaScript 動態插入連結,且連結不是标准 a 标簽,蜘蛛無法顺着点击事件走。
- 連結被 nofollow、robots 或 meta 規則挡住,蜘蛛能看到連結但不會繼續抓取。
- 頁面藏在篩選、分頁或參數组合後面,入口很深,連結路径容易断掉。
- 新頁面發布後没有從任何已有頁面連結過去,只提交了 URL。
- 内鏈只放在頁脚或侧栏,且全站重复,蜘蛛不一定會把它当作重要入口。
- Sitemap 有记錄,但站内長期没有入口連結,頁面逐渐變成孤岛。
怎么排查孤岛頁面
可以先從日誌和抓取工具入手,按顺序核對:
- 用日誌分析工具,看目标 URL 是否有蜘蛛訪問记錄,以及訪問频率是否明顯低于同层級頁面。
- 用站点爬虫模拟抓取,查看從首頁出發能走到哪些頁面,哪些頁面不在路径内。
- 检查内鏈报告,看頁面的入鏈數量和来源頁面,判断它是否只依赖 Sitemap 或提交接口。
- 核對 Sitemap 與實际内鏈是否一致,找出“已列出但無入口”的頁面。
如果某個頁面在 Sitemap 里,但站内没有任何可抓取入口連結,它就很可能是孤岛頁面。此时不要急着反复提交 URL,先检查内鏈结构。
把孤岛頁面接回抓取路径
修复思路是给它增加稳定的内鏈入口,让蜘蛛能沿着已有路径走到:
- 從相關频道頁、列表頁或聚合頁添加入口連結,優先放在离首頁較近的层級。
- 在正文中做上下文内鏈,連結到相關頁面,让連結位置和内容主题相關。
- 用面包屑或标簽頁串联同主题頁面,减少頁面之間的跳轉断层。
- 如果同類頁面較多,可以做一個索引頁,集中列出入口,再由索引頁連結到詳情頁。
- 确保連結是可抓取的 a 标簽,避免依赖按钮、表單或纯 JS 跳轉。
Sitemap 可以作為辅助發現通道,但不要把它当成唯一入口。蜘蛛更倾向于沿着站内連結逐步抓取,内鏈稳定的頁面通常更容易被持續訪問。
注意事項
增加内鏈时,要控制數量和质量,避免為了抓取而堆砌連結。連結應该對用戶也有帮助,否則可能影响頁面体驗。
另外,如果服務器不稳定,蜘蛛即使走到入口,也可能因為超时或错誤反复中断。保持响應稳定、减少 5xx 和连接失敗,有助于提高抓取完成度。對于重要頁面,建议同时检查移動端和桌面端的連結是否都能正常呈現。
孤岛頁面的修复不是一次性的。站点结构、栏目和内容都會變化,定期用日誌和爬虫工具核對抓取路径,才能及时發現新的孤岛頁面,並把它重新接回可抓取的連結網絡。