Sitemap 经常被当成一个“提交就给收录”的开关。实际上它只是 URL 发现 环节里的一个入口,和收录判断是两件事。提交之后能不能进索引,仍然取决于页面本身。
Sitemap 在做什么
它的核心作用只有一个:告诉蜘蛛“这些 URL 存在”。蜘蛛不必靠翻内链一层层爬,才能发现它们。对于层级很深、内链入口很少、刚上线的页面,这个提示是有价值的。
但被发现只是流程的起点。蜘蛛接下来还要抓取、渲染、判断页面质量,才可能把地址放进索引。这几步里任何一步出问题,sitemap 都帮不上忙。
什么该放,什么不该放
地图里应该只放 希望被索引的规范 URL。常见的错误是把下面这些也塞进去:
- 已经加了 noindex 的页面
- 会 301 或 302 跳走的旧地址
- 返回 404、410 的失效页
- 带排序、筛选、追踪参数的重复地址
- 登录后才可见、对蜘蛛返回空壳的页面
这些条目不会被收录,还会让蜘蛛对整份地图的可信度打折。当地图里无效 URL 占比过高时,它对有效 URL 的提示作用也会被一起削弱。
只放你选定的那个版本
如果一个页面有多个可访问地址,地图里只放你认定的规范版本,其余靠 canonical 或跳转收拢。别把同一内容的几个变体全部列进去,那等于亲手制造重复。
URL 发现还有别的入口
sitemap 不是唯一通道。蜘蛛也会沿着站内链接走,通过外链跳转进来,读取 RSS 或接口返回的地址列表。运营侧有时会用蜘蛛池之类的方式提高抓取频次,让重要 URL 更快被访问到。
这些手段解决的都是“被发现”和“被抓取”的效率问题,并不改变页面是否值得进索引。
抓取频次可以提高,收录门槛不会因此降低。
提交后仍不收录,按这个顺序查
- 页面是否返回 200,关闭 JS 后主体文本是否还能拿到
- 是否有 noindex、robots 屏蔽、登录墙挡在抓取前面
- 页面的规范 URL 是否指向自己,而不是被别人 canonical 走
- 页面上是否只有模板和广告,缺少独立信息
- 整站是否长期输出大量低价值页面,拖累了新页面的判断
- 最后才看 sitemap 的格式、位置和声明是否正确
顺序别倒过来,sitemap 往往是最后一个需要动的地方。
把它当体检表,不是许愿池
地图里 URL 的收录比例,可以当作一个粗略的观察指标。比例长期偏低,说明问题多半出在页面质量或站点结构上,而不是提交这个动作本身。