網站收錄

Sitemap 提交了,URL 還是没進索引:它能做和不能做的事

站点地图能帮蜘蛛發現 URL,但它不是收錄開關。把不可索引的頁面、重定向和參數頁塞進 sitemap,反而會稀释整份地图的可信度。這篇文章说清 sitemap 在 URL 發現鏈條里的位置,以及提交之後仍然不收錄时,應该按什么顺序排查。

網站收錄

Sitemap 提交了,URL 還是没進索引:它能做和不能做的事

Sitemap 经常被当成一個“提交就给收錄”的開關。實际上它只是 URL 發現 环节里的一個入口,和收錄判断是两件事。提交之後能不能進索引,仍然取决于頁面本身。

Sitemap 在做什么

它的核心作用只有一個:告诉蜘蛛“這些 URL 存在”。蜘蛛不必靠翻内鏈一层层爬,才能發現它們。對于层級很深、内鏈入口很少、刚上线的頁面,這個提示是有價值的。

但被發現只是流程的起点。蜘蛛接下来還要抓取、渲染、判断頁面质量,才可能把地址放進索引。這几步里任何一步出問题,sitemap 都帮不上忙。

什么该放,什么不该放

地图里應该只放 希望被索引的規范 URL。常见的错誤是把下面這些也塞進去:

  • 已经加了 noindex 的頁面
  • 會 301 或 302 跳走的舊地址
  • 返回 404、410 的失效頁
  • 带排序、篩選、追踪參數的重复地址
  • 登入後才可见、對蜘蛛返回空壳的頁面

這些條目不會被收錄,還會让蜘蛛對整份地图的可信度打折。当地图里無效 URL 占比過高时,它對有效 URL 的提示作用也會被一起削弱。

只放你選定的那個版本

如果一個頁面有多個可訪問地址,地图里只放你認定的規范版本,其余靠 canonical 或跳轉收拢。別把同一内容的几個變体全部列進去,那等于亲手制造重复。

URL 發現還有別的入口

sitemap 不是唯一通道。蜘蛛也會沿着站内連結走,通過外鏈跳轉進来,讀取 RSS 或接口返回的地址列表。运营侧有时會用蜘蛛池之類的方式提高抓取频次,让重要 URL 更快被訪問到。

這些手段解决的都是“被發現”和“被抓取”的效率問题,並不改變頁面是否值得進索引。

抓取频次可以提高,收錄门槛不會因此降低。

提交後仍不收錄,按這個顺序查

  1. 頁面是否返回 200,關閉 JS 後主体文本是否還能拿到
  2. 是否有 noindex、robots 屏蔽、登入墙挡在抓取前面
  3. 頁面的規范 URL 是否指向自己,而不是被別人 canonical 走
  4. 頁面上是否只有模板和广告,缺少獨立信息
  5. 整站是否長期輸出大量低價值頁面,拖累了新頁面的判断
  6. 最後才看 sitemap 的格式、位置和声明是否正确

顺序別倒過来,sitemap 往往是最後一個需要動的地方。

把它当体检表,不是许愿池

地图里 URL 的收錄比例,可以当作一個粗略的观察指标。比例長期偏低,說明問题多半出在頁面质量或站点结构上,而不是提交這個動作本身。