網站收錄

只在 Sitemap 里出現的頁面:孤岛 URL 的發現路径與收錄核對

有些頁面狀態正常、内容完整,Sitemap 里也列着,却迟迟不收錄。問题常常不在内容,而在站内没有任何連結指向它。本文把發現路径拆成内鏈、Sitemap、外鏈几條线,给出從入口检查到抓取日誌的核對顺序,帮助判断是卡在發現、抓取還是入库环节。

網站收錄

只在 Sitemap 里出現的頁面:孤岛 URL 的發現路径與收錄核對

站点里常有一類頁面:狀態碼正常、内容也寫得完整,Sitemap 里列着,但搜尋里几乎看不到它。排查时容易一头扎進“内容质量”,實际上更常见的原因是——除了 Sitemap,站内没有任何一條連結指向它。發現 URL 的路径断了一條,收錄自然慢。

先把“發現路径”這個概念理清

搜尋引擎發現一個 URL,通常有几條路:站内連結(導航、正文、列表、相關推荐)、Sitemap、外部連結,以及歷史已知地址的重复抓取。其中站内連結的作用最大,因為它同时传递了“這個頁面在站内處于什么位置”的信息。Sitemap 只解决“我知道有這條 URL”,不解决“它有多重要”。

当一條 URL 只靠 Sitemap 出現,它就成了孤岛:蜘蛛知道它存在,但没有上下文說明它和站内其他頁面是什么關系。抓取队列里,這類 URL 往往排在後面。

孤岛 URL 常见的几種产生方式

  • 批量生成的落地頁,只寫進 Sitemap,没有從栏目頁鏈出去。
  • 舊内容改版後被移出導航,却没有做跳轉或保留入口。
  • 由前端路由或 JS 渲染出的連結,爬虫拿不到 href。
  • 連結挂在登入後、彈窗里或懒加载区块中,預設不可见。
  • 分站、频道頁之間没有互鏈,各管各的。

核對顺序:從内鏈開始,而不是從内容開始

  1. 先查站内是否有入口。用站内搜尋或抓取工具跑一遍,看有没有頁面連結到這個 URL。如果一條都没有,問题就在這里,不必先怀疑内容。
  2. 再看入口的可抓取性。有連結不等于能被發現:連結若是 JS 動態插入、被 nofollow 标记、要点击按钮才加载,效果會打折扣。核對时把“連結存在”和“連結可被抓取”分開確認。
  3. 確認 Sitemap 的一致性。URL 是否與頁面真實地址完全一致(协议、尾斜杠、參數),返回狀態是否為 200。Sitemap 里寫了 404 或重定向地址,等于给了一條無效线索。
  4. 检查頁面的獨立價值。孤岛頁面里有相当比例是内容相近的模板頁或參數頁。如果没有内鏈、内容又高度重复,即使被抓,也很可能停在“已抓取、未编入索引”。
  5. 最後看抓取日誌。如果日誌里從未出現该 URL,說明它還停在發現阶段;如果抓過但没收錄,才需要轉向质量與重复的排查。
先分清“没被發現”和“被發現但没收錄”,這两類問题的處理方向完全不同。孤岛 URL 大多属于前者。

處理方式

最直接的办法是补内鏈:從相關栏目、正文或聚合頁里自然鏈過去,让 URL 回到站内结构里。如果頁面數量很大,不必全都补,先挑有價值的加連結,其余考虑合並或下线。

另外要控制批量生成的速度。一次性往 Sitemap 里加几千條無内鏈的 URL,抓取预算會被摊薄,老頁面和重要頁面反而受影响。

补鏈之後怎么驗證

补上入口後,不要立刻期待收錄狀態變化。可以按顺序观察:站内抓取工具能否顺着新連結走到该 URL;服務器日誌里是否出現该地址的抓取记錄;再到搜尋中確認是否進入索引。三步分開看,能判断是卡在發現、抓取還是入库环节。

小结

頁面不收錄时,把“發現路径”当作第一站排查項,往往比反复改内容更快找到原因。Sitemap 负责告知,内鏈负责背书,两者缺一,收錄就容易卡住。