网站收录

Sitemap 提交了,URL 还是没进索引:它能做和不能做的事

站点地图能帮蜘蛛发现 URL,但它不是收录开关。把不可索引的页面、重定向和参数页塞进 sitemap,反而会稀释整份地图的可信度。这篇文章说清 sitemap 在 URL 发现链条里的位置,以及提交之后仍然不收录时,应该按什么顺序排查。

网站收录

Sitemap 提交了,URL 还是没进索引:它能做和不能做的事

Sitemap 经常被当成一个“提交就给收录”的开关。实际上它只是 URL 发现 环节里的一个入口,和收录判断是两件事。提交之后能不能进索引,仍然取决于页面本身。

Sitemap 在做什么

它的核心作用只有一个:告诉蜘蛛“这些 URL 存在”。蜘蛛不必靠翻内链一层层爬,才能发现它们。对于层级很深、内链入口很少、刚上线的页面,这个提示是有价值的。

但被发现只是流程的起点。蜘蛛接下来还要抓取、渲染、判断页面质量,才可能把地址放进索引。这几步里任何一步出问题,sitemap 都帮不上忙。

什么该放,什么不该放

地图里应该只放 希望被索引的规范 URL。常见的错误是把下面这些也塞进去:

  • 已经加了 noindex 的页面
  • 会 301 或 302 跳走的旧地址
  • 返回 404、410 的失效页
  • 带排序、筛选、追踪参数的重复地址
  • 登录后才可见、对蜘蛛返回空壳的页面

这些条目不会被收录,还会让蜘蛛对整份地图的可信度打折。当地图里无效 URL 占比过高时,它对有效 URL 的提示作用也会被一起削弱。

只放你选定的那个版本

如果一个页面有多个可访问地址,地图里只放你认定的规范版本,其余靠 canonical 或跳转收拢。别把同一内容的几个变体全部列进去,那等于亲手制造重复。

URL 发现还有别的入口

sitemap 不是唯一通道。蜘蛛也会沿着站内链接走,通过外链跳转进来,读取 RSS 或接口返回的地址列表。运营侧有时会用蜘蛛池之类的方式提高抓取频次,让重要 URL 更快被访问到。

这些手段解决的都是“被发现”和“被抓取”的效率问题,并不改变页面是否值得进索引。

抓取频次可以提高,收录门槛不会因此降低。

提交后仍不收录,按这个顺序查

  1. 页面是否返回 200,关闭 JS 后主体文本是否还能拿到
  2. 是否有 noindex、robots 屏蔽、登录墙挡在抓取前面
  3. 页面的规范 URL 是否指向自己,而不是被别人 canonical 走
  4. 页面上是否只有模板和广告,缺少独立信息
  5. 整站是否长期输出大量低价值页面,拖累了新页面的判断
  6. 最后才看 sitemap 的格式、位置和声明是否正确

顺序别倒过来,sitemap 往往是最后一个需要动的地方。

把它当体检表,不是许愿池

地图里 URL 的收录比例,可以当作一个粗略的观察指标。比例长期偏低,说明问题多半出在页面质量或站点结构上,而不是提交这个动作本身。