Sitemap 经常被当成一個“提交就给收錄”的開關。實际上它只是 URL 發現 环节里的一個入口,和收錄判断是两件事。提交之後能不能進索引,仍然取决于頁面本身。
Sitemap 在做什么
它的核心作用只有一個:告诉蜘蛛“這些 URL 存在”。蜘蛛不必靠翻内鏈一层层爬,才能發現它們。對于层級很深、内鏈入口很少、刚上线的頁面,這個提示是有價值的。
但被發現只是流程的起点。蜘蛛接下来還要抓取、渲染、判断頁面质量,才可能把地址放進索引。這几步里任何一步出問题,sitemap 都帮不上忙。
什么该放,什么不该放
地图里應该只放 希望被索引的規范 URL。常见的错誤是把下面這些也塞進去:
- 已经加了 noindex 的頁面
- 會 301 或 302 跳走的舊地址
- 返回 404、410 的失效頁
- 带排序、篩選、追踪參數的重复地址
- 登入後才可见、對蜘蛛返回空壳的頁面
這些條目不會被收錄,還會让蜘蛛對整份地图的可信度打折。当地图里無效 URL 占比過高时,它對有效 URL 的提示作用也會被一起削弱。
只放你選定的那個版本
如果一個頁面有多個可訪問地址,地图里只放你認定的規范版本,其余靠 canonical 或跳轉收拢。別把同一内容的几個變体全部列進去,那等于亲手制造重复。
URL 發現還有別的入口
sitemap 不是唯一通道。蜘蛛也會沿着站内連結走,通過外鏈跳轉進来,讀取 RSS 或接口返回的地址列表。运营侧有时會用蜘蛛池之類的方式提高抓取频次,让重要 URL 更快被訪問到。
這些手段解决的都是“被發現”和“被抓取”的效率問题,並不改變頁面是否值得進索引。
抓取频次可以提高,收錄门槛不會因此降低。
提交後仍不收錄,按這個顺序查
- 頁面是否返回 200,關閉 JS 後主体文本是否還能拿到
- 是否有 noindex、robots 屏蔽、登入墙挡在抓取前面
- 頁面的規范 URL 是否指向自己,而不是被別人 canonical 走
- 頁面上是否只有模板和广告,缺少獨立信息
- 整站是否長期輸出大量低價值頁面,拖累了新頁面的判断
- 最後才看 sitemap 的格式、位置和声明是否正确
顺序別倒過来,sitemap 往往是最後一個需要動的地方。
把它当体检表,不是许愿池
地图里 URL 的收錄比例,可以当作一個粗略的观察指标。比例長期偏低,說明問题多半出在頁面质量或站点结构上,而不是提交這個動作本身。