頁面没被收錄,很多人第一反應是去改 sitemap、加提交、找蜘蛛池。但有一個更基础的問题经常被跳過:這個 URL 在站内有没有連結指向它。如果一個頁面只能通過站点地图、手動提交或者外鏈到達,站内任何位置都点不到它,它就是一個孤岛頁面。蜘蛛發現它的路径非常單一,收錄慢、索引狀態反复,都不奇怪。
孤岛頁面常见的形成方式
- 栏目改版或合並後,舊入口被删掉,頁面還留着,但已经没有導航、列表或正文連結指向它。
- 頁面只能通過站内搜尋、篩選條件打開,而搜尋頁本身不打算让蜘蛛抓。
- 導航和列表由 JS 渲染,蜘蛛拿到的 HTML 里没有可跟随的連結。
- 為了让所谓“權重集中”,把内頁連結统一加上 nofollow 或直接屏蔽。
- 内容量大,只把 URL 一股脑塞進 sitemap,站内没有任何交叉連結。
這些情况有一個共同点:URL 存在,但站内没有一條可抓取的路径通向它。sitemap 的作用是补充提示,不是替代内鏈。
内鏈為什么會影响收錄
蜘蛛主要靠連結發現頁面。一個頁面被連結的次數、連結出現的位置、锚文本的内容,都會影响蜘蛛對它的判断,也會影响它在抓取队列里的優先級。
- 發現路径:内鏈多、位置靠前,蜘蛛更容易在下一轮抓取里碰到它;只有 sitemap 提示的頁面,往往要等更久。
- 價值判断:被多個相關頁面引用的内容,更容易被当成站内重要内容;一個谁都不提的頁面,蜘蛛缺少判断依據。
- 抓取調度:站点規模大时,蜘蛛的抓取額度有限,孤岛頁面通常排在後面。
需要注意的是,内鏈只是让頁面更容易被發現、更容易被理解,不等于加了連結就一定會被收錄。頁面本身是否有獨立價值,仍然是前提。
怎么把孤岛頁面找出来
- 先對照 sitemap 和站内實际連結:把 sitemap 里的 URL 抽一批出来,逐個看它在站内有没有至少一個正常連結指向它。
- 在服務器日誌里查這些 URL 有没有被抓過,以及被抓时带的来源是什么。如果来的路径几乎都是外部来源,站内連結大概率是缺的。
- 检查点击深度。從一個典型頁面出發,几跳能点到目标頁。超過四五跳還没到,效果會明顯打折。
- 抽查導航和列表頁渲染後的 HTML,確認連結是不是真的出現在源碼里,而不是只出現在浏览器里。
补連結时的几個取舍
- 優先补有上下文的位置:正文相關推荐、同主题列表、面包屑,比頁脚全站連結更有意义。
- 控制數量。一個頁面塞几十上百條連結,反而會稀释每條連結的作用。
- 锚文本寫清楚内容主题,別统一用“点击這里”“查看更多”。
- 舊連結能恢复就恢复,不必為了一個頁面重做整個導航。
- 頁面本身没有獨立内容價值的,可以考虑合並或下掉,而不是硬给它补連結。
补完之後怎么观察
不要指望改完第二天就收錄。合理的做法是先记錄改動時間,然後按同一批 URL 连續观察两到四周:看日誌里這些 URL 被抓的次數有没有變化,抓取时是從哪些頁面進来的,再看索引狀態是否稳定。如果抓取量上来了、索引還是不動,那問题多半在頁面质量或内容重复上,而不是連結。
内鏈解决的是“蜘蛛能不能顺利找到並理解這個頁面”,收錄是它之後的事。把發現路径修好,是排查收錄問题的第一步,但不是全部。