网站收录

sitemap 提交了却没收录:它到底能帮到什么

sitemap 常被当成“提交即收录”的开关,其实它只作用在 URL 发现这一环。本文说明 sitemap 能做什么、帮不上什么,并给出提交后页面仍未被收录时的检查顺序,包括 robots、noindex、规范 URL、抓取状态和页面质量。

网站收录

sitemap 提交了却没收录:它到底能帮到什么

sitemap 解决的是“被发现”,不是“被收录”

不少人把 sitemap 当成一个开关:提交上去,页面就该进索引。实际流程要拆成三步——URL 被发现、页面被抓取、页面被判定为值得收录。sitemap 主要作用在第一步:它给抓取器一份站点 URL 清单,省去靠链接一层层爬过去的时间。至于后面两步,取决于页面能不能正常访问、内容有没有独立价值、是否与站内其他页面高度重复,以及站点整体能分到多少抓取配额。

所以“提交了 sitemap,收录数量却没动”是很常见的现象。问题可能出在文件写法上,也可能出在页面本身。

先确认 sitemap 有没有被正确读取

文件本身是否有效

  • 格式要规范:单个文件 URL 数量与体积都有上限,超出后需要拆成多个文件并用索引文件串联。
  • URL 中的特殊符号要按 XML 规则转义,否则整段内容可能解析失败。
  • 只放规范地址:带追踪参数的、大小写混用的、会跳转的 URL 都不该出现在这里。
  • lastmod 要写真实时间。习惯性把时间刷成“今天”,久而久之会被忽略。

位置和声明是否到位

把 sitemap 放在站点根目录,并在 robots.txt 里写明它的位置,能让抓取器更快找到。接着到搜索后台看提交状态和“已发现的页面数”。如果长期显示无法读取,多半是被 robots 挡住了、返回码不对,或者文件路径写错。

sitemap 里的 URL 为什么进不了索引

  • 抓取被屏蔽:robots.txt 挡住了目录,页面连被抓的机会都没有。
  • 页面带 noindex:这和提交 sitemap 是两个相反方向的信号,最终以 noindex 为准。
  • URL 不是规范版本:canonical 指向了另一个地址,收录只会记在目标页上。
  • 返回码不对:出现 404、410 或 301 的地址应及时从清单里移除,只保留正常返回的最终地址。
  • 抓取器看到的内容不同:需要登录、按地域拦截或首屏全靠脚本渲染,都可能让它只看到一个空壳。
  • 页面本身价值不够:内容太薄、与其他页面高度重复,即使被发现也很难留下。

sitemap 帮不上忙的几件事

它不能提升页面质量,不能替代内部链接,也不能改变抓取频率。它是补充手段,不是主力通道:一个长期没有内链指向、离首页很远的页面,即使躺在 sitemap 里,被抓取的优先级也有限。至于蜘蛛池这类工具,做的事同样停留在“增加被发现的机会”这一层,对收录结论没有决定权。

提交之后仍没收录,按这个顺序查

  1. 用 URL 检查类工具看这个地址是否被抓取过、返回什么状态码。
  2. 检查 robots.txt 与页面 meta,确认允许抓取、允许索引。
  3. 确认 sitemap 里写的是规范地址,并且和 canonical 保持一致。
  4. 判断这个页面值不值得留:内容是否独立、有没有内链指向、点击深度是否太深。
  5. 给它一点时间。新站或新目录可用的抓取配额有限,收录通常分批发生,不会一次到位。
sitemap 是递给抓取器的一张地图,不是一道命令。地图画得再清楚,走不走、记不记,仍然由页面本身决定。

把 sitemap 看作“索引的入场券”容易失望,把它看作“减少发现成本的小工具”更接近事实。真正影响收录的,仍是那些能访问、有内容、有内链的页面。