網站收錄

孤岛 URL:没有内鏈入口的頁面是怎么被漏掉的

頁面内容没問题,却迟迟不见被抓取,很多时候不是质量或權重問题,而是根本没人連結它。本文說明爬虫發現 URL 的三條主要路径,拆解内鏈最容易断掉的位置,並给出找出與补救孤岛頁面的具体顺序。

網站收錄

孤岛 URL:没有内鏈入口的頁面是怎么被漏掉的

先区分两件事:内容好不好,和有没有入口

收錄出問题时,多數人的第一反應是检查内容质量、修改标题、重新提交。但如果一個頁面在站内没有任何連結指向它,站点地图里也没有它,那么它很可能连被抓取队列看见的机會都没有。這類頁面通常被称為孤岛 URL(orphan URL)。

它和质量差導致不收錄是两回事:质量問题的頁面會被抓取、被评估,然後才被判定為不值得索引;而孤岛頁面的狀態往往停留在「未知」,爬虫根本不知道它存在。

爬虫發現新 URL 的三條主要路径

一個 URL 要進入待抓取队列,通常得從下面某個入口被顺藤摸瓜地發現:

  • 站内連結:最稳定也最重要的一條。爬虫從已知頁面出發,沿 <a> 标簽逐层向外扩展。
  • 站点地图:适合提交數量大、层級深或内鏈薄弱的頁面,但它更像是补漏手段,不能完全替代内鏈。
  • 外部連結:其他網站指向你的連結同样能被發現,但可控性最低,也不适合依赖。

除此之外,重定向鏈、被抓取過的舊 URL 里的新連結,也可能成為入口。但把希望寄托在這些随机路径上,會带来很大的不确定性。

内鏈最常断掉的几個位置

1. 連結藏在需要交互才出現的地方

下拉菜單、Tab 切換、点击展開的「更多」列表,如果它們不是預設出現在 HTML 里,爬虫就可能看不到其中包含的連結。判断方法很简單:打開頁面源代碼搜尋那個 URL,搜不到就意味着這條路對爬虫是断的。

2. 依赖 JS 渲染出来的導航

使用前端框架时,導航連結常常由脚本動態插入。渲染能力强的搜尋引擎能處理一部分,但渲染有延迟、有预算,也不保證每個頁面都會执行。把關键導航保留一份可被直接解析的 HTML 連結,是更稳妥的做法。

3. 分頁只提供「上一頁 / 下一頁」

列表頁很長时,若翻頁只暴露相邻两頁的連結,靠後的内容虽然理论上可到達,但点击深度會非常深,被發現的優先級也會被推後。适当保留可点击的數字頁碼,或按分類、時間归档建立入口,能顯著缩短路径。

4. 被属性挡住的連結

nofollow、rel="ugc"、robots 指令或 onclick 跳轉,都會改變爬虫對連結的處理方式。它們不一定阻止發現,但會让這條路径的價值打折。站内重要的導航與内容入口,不建议加這類属性。

怎么找出站内的孤岛頁面

  1. 用爬虫工具或站点审計工具抓一遍全站,得到「站内可到達的 URL 列表」。
  2. 導出站点地图、後台内容库或資料库中的所有 URL,作為第二份列表。
  3. 對照两份列表,只在第二份里出現的就是可疑的孤岛頁面。
  4. 再從服務器日誌里看看這些 URL 是否出現過。如果長期完全没有任何抓取记錄,基本可以確認入口缺失。
  5. 抽查几個孤岛頁面的源代碼,確認是不是連結被 JS、属性或交互遮挡了。

补救的顺序

  1. 先判断這個頁面值不值得被收錄。内容重复、已下线、纯功能頁,直接让它保持孤立甚至設定 noindex 更合适。
  2. 值得保留的頁面,回到站内找自然的相關位置加連結——上級分類、相關文章、正文内提及,優先選擇语义相關的位置。
  3. 补充站点地图,作為兜底入口,但不要把它当成唯一手段。
  4. 如果頁面属于某個栏目,检查该栏目的列表頁是否覆盖了它,分頁是否可完整遍歷。
  5. 改完後观察一段時間日誌,確認抓取是否出現,再判断是否需要進一步調整。

几点提醒

第一,孤岛頁面不一定會被索引,但也不等于永久不被發現,外鏈、分享、舊頁面残留連結都可能把它带出来,所以別只看單次结果。

第二,内鏈的意义不只是「让爬虫找到」,也包括给頁面一個明确的位置和上下文。單纯為了收錄堆砌連結,效果有限,還可能稀释其他頁面的入口。

第三,處理這類問题时,優先解决入口,而不是急着重新提交或反复修改内容。入口没通的情况下,後两步通常不會带来變化。