网站收录

站点地图提交了却不收录:先清理 sitemap 里的三类 URL

站点地图只负责帮助发现 URL,并不保证抓取和收录。真正影响效果的是文件里放了什么:不可索引的地址、会跳转或已失效的地址、重复的参数组合,都会稀释这份文件的参考价值。本文给出 lastmod 的正确用法、分片原则和一份可执行的核对顺序。

网站收录

站点地图提交了却不收录:先清理 sitemap 里的三类 URL

站点地图被不少人当成“提交即收录”的开关,实际上它只负责一件事:帮助搜索引擎发现 URL。发现之后是否抓取、抓取之后是否进入索引,仍取决于页面本身的可抓取性、内容质量和重复情况。所以当文件里列了几百个地址、收录数字却几乎没动时,问题往往不在“提交”这个动作,而在文件里放了什么。

sitemap 只解决发现环节

它是一份候选清单,不是索引指令。把不可索引、不值得索引的地址混进去,会带来两个后果:一是抓取资源被消耗在无效地址上,二是在长期只看到无效 URL 的情况下,调度方会降低对整个文件的采信程度。换句话说,sitemap 的效力取决于里面 URL 的干净程度,而不是提交次数。

三类最该先清出去的 URL

明确不可索引的地址

被 robots.txt 屏蔽的路径、带 noindex 的页面、需要登录才能访问的页面,都不应出现在文件里。这类地址反复被抓取却始终返回“不要索引”的信号,对整份清单没有正面作用。

会跳转的地址与已失效的地址

sitemap 只应写入最终状态码为 200 的规范 URL。把 301 之前的旧地址、返回 404 或 410 的地址列进去,等于让发现环节绕路。站点改版或换域名后,旧的 sitemap 文件要及时下线或替换,避免新旧两份并存、互相指向。

重复版本与参数组合

带排序、筛选、跟踪参数的 URL 通常与主版本高度重复。如果这些页面没有独立价值,就不要逐个列入。分页序列一般通过页面之间的链接自然衔接即可,不必把每一页都塞进文件。

lastmod 不是装饰字段

它代表内容的最后实质性修改时间,而不是模板渲染时间或文件生成时间。如果每次生成文件都把 lastmod 刷成当前时间,而页面正文并没有变化,这个字段很快会失去参考价值——调度方看到“天天更新”却抓不到新内容,就会降低对它的信任。更稳妥的做法是:只在正文、价格、库存等实质内容变动时才更新该字段,并保持格式统一。

分片与索引文件

单个文件建议不超过五万条 URL、压缩前不超过 50MB,超出后拆分成多个子文件,并用一个索引文件指向它们。分片的意义在于让读取方分批处理、分批判断,而不是让文件结构更整齐。如果其中一份长期塞满失效地址,影响的不只是那一份。

一份可执行的核对顺序

  1. 确认 sitemap 地址可正常访问、返回 200,且与 robots.txt 中的声明一致。
  2. 抽样检查文件内 URL 是否全为最终规范版本:无跳转、无多余参数、无 noindex 页面。
  3. 抽查 lastmod 与内容实际变更时间是否吻合,剔除批量刷新的假时间戳。
  4. 对比文件中的 URL 数量与索引中的实际数量,找出长期“列了但未被处理”的区间。
  5. 对长期不被抓取的部分,回到内链结构和页面质量上找原因,而不是反复重新提交。

提交之后还要看什么

文件只是入口,真正的通路是内链。一个只在 sitemap 里出现、站内没有任何链接指向的孤立 URL,被抓取的概率依然偏低。因此排查顺序通常是:先清理文件内容,再检查这些 URL 是否从导航或正文中可达,最后才看内容本身是否具备被索引的条件。

站点地图是“告知”,不是“要求”。它的价值来自清单里 URL 的准确与干净,而不来自提交动作本身。