站点里常有一類頁面:狀態碼正常、内容也寫得完整,Sitemap 里列着,但搜尋里几乎看不到它。排查时容易一头扎進“内容质量”,實际上更常见的原因是——除了 Sitemap,站内没有任何一條連結指向它。發現 URL 的路径断了一條,收錄自然慢。
先把“發現路径”這個概念理清
搜尋引擎發現一個 URL,通常有几條路:站内連結(導航、正文、列表、相關推荐)、Sitemap、外部連結,以及歷史已知地址的重复抓取。其中站内連結的作用最大,因為它同时传递了“這個頁面在站内處于什么位置”的信息。Sitemap 只解决“我知道有這條 URL”,不解决“它有多重要”。
当一條 URL 只靠 Sitemap 出現,它就成了孤岛:蜘蛛知道它存在,但没有上下文說明它和站内其他頁面是什么關系。抓取队列里,這類 URL 往往排在後面。
孤岛 URL 常见的几種产生方式
- 批量生成的落地頁,只寫進 Sitemap,没有從栏目頁鏈出去。
- 舊内容改版後被移出導航,却没有做跳轉或保留入口。
- 由前端路由或 JS 渲染出的連結,爬虫拿不到 href。
- 連結挂在登入後、彈窗里或懒加载区块中,預設不可见。
- 分站、频道頁之間没有互鏈,各管各的。
核對顺序:從内鏈開始,而不是從内容開始
- 先查站内是否有入口。用站内搜尋或抓取工具跑一遍,看有没有頁面連結到這個 URL。如果一條都没有,問题就在這里,不必先怀疑内容。
- 再看入口的可抓取性。有連結不等于能被發現:連結若是 JS 動態插入、被 nofollow 标记、要点击按钮才加载,效果會打折扣。核對时把“連結存在”和“連結可被抓取”分開確認。
- 確認 Sitemap 的一致性。URL 是否與頁面真實地址完全一致(协议、尾斜杠、參數),返回狀態是否為 200。Sitemap 里寫了 404 或重定向地址,等于给了一條無效线索。
- 检查頁面的獨立價值。孤岛頁面里有相当比例是内容相近的模板頁或參數頁。如果没有内鏈、内容又高度重复,即使被抓,也很可能停在“已抓取、未编入索引”。
- 最後看抓取日誌。如果日誌里從未出現该 URL,說明它還停在發現阶段;如果抓過但没收錄,才需要轉向质量與重复的排查。
先分清“没被發現”和“被發現但没收錄”,這两類問题的處理方向完全不同。孤岛 URL 大多属于前者。
處理方式
最直接的办法是补内鏈:從相關栏目、正文或聚合頁里自然鏈過去,让 URL 回到站内结构里。如果頁面數量很大,不必全都补,先挑有價值的加連結,其余考虑合並或下线。
另外要控制批量生成的速度。一次性往 Sitemap 里加几千條無内鏈的 URL,抓取预算會被摊薄,老頁面和重要頁面反而受影响。
补鏈之後怎么驗證
补上入口後,不要立刻期待收錄狀態變化。可以按顺序观察:站内抓取工具能否顺着新連結走到该 URL;服務器日誌里是否出現该地址的抓取记錄;再到搜尋中確認是否進入索引。三步分開看,能判断是卡在發現、抓取還是入库环节。
小结
頁面不收錄时,把“發現路径”当作第一站排查項,往往比反复改内容更快找到原因。Sitemap 负责告知,内鏈负责背书,两者缺一,收錄就容易卡住。