网站收录

提交了 sitemap 还是收录慢:站点地图能做什么、不能做什么

站点地图常被当成提交即收录的开关,实际上它只是 URL 发现的补充来源。本文说明 sitemap 的作用边界、一份能被正常处理的清单该满足哪些条件、lastmod 为何不能乱写,以及提交后仍不收录时应按抓取、响应、内容、索引、展示的顺序逐层排查,并解释为什么内链比反复重传文件更有效。

网站收录

提交了 sitemap 还是收录慢:站点地图能做什么、不能做什么

很多站长把 sitemap 当成“提交就能收录”的开关:文件传上去,后台显示成功,然后开始等索引。几天过去,新页面还在原地。问题往往不在提交动作本身,而在于对站点地图的定位有偏差。它是一份“我这里有这些地址”的声明,不是加速收录的按钮。

sitemap 的作用边界

搜索引擎把 sitemap 当作 URL 发现的补充来源之一,主要解决两件事:让新页面更快进入待抓取队列,以及为已收录页面提供 lastmod 之类的更新参考。但它不决定抓取频次,也不决定页面是否值得进索引。后两个判断由内容质量、服务器响应、站点整体情况、内链结构共同影响。所以一份格式完美、地址齐全的 sitemap,也可能带来零收录增长。

一份能被正常处理的 sitemap

  • 只放规范地址:协议、域名前缀保持一致,不带跟踪参数、不带会话 ID。
  • 只放返回 200 且允许索引的页面:noindex、需登录、被 robots 屏蔽的地址不要写进去。
  • 单文件不超过 5 万条、50MB,超出就分片,并用一个索引文件串起来。
  • 编码用 UTF-8,地址做好转义,不要夹带 HTML 或脚本内容。
  • 在 robots.txt 里写明 Sitemap 位置,方便爬虫顺路取用。

lastmod 写错比不写更糟

lastmod 是爬虫判断“这个页面是否真的变了”的依据。如果每次部署都批量刷新时间戳,而正文没有任何改动,爬虫几次下来就会发现这个字段不可信,之后不再参考。只在该页面内容确实修改时更新,使用标准日期格式,精确到天通常就够。

提交了仍然不收录,按这个顺序查

  1. 抓取层面:查看访问日志或后台数据,确认爬虫有没有来过。没来,说明站内入口太弱,sitemap 只是一条候选线索。
  2. 响应层面:抓取时是否频繁超时、返回 5xx,或者对爬虫的限速过严。
  3. 内容层面:页面是否有足够的独立信息,还是模板拼出来的空壳;同主题是否存在多个近似版本互相稀释。
  4. 索引层面:确认页面没有 noindex,canonical 没有指向别处,也没有被 robots 挡在抓取之外。
  5. 展示层面:如果已经进了索引却搜不到关键词,那属于可见性与竞争问题,和 sitemap 基本无关。

sitemap 替代不了内链

sitemap 提供的是“存在性”,内链提供的是“重要性与上下文”。一个只能从 sitemap 找到、站内没有任何入口的页面,抓取频次通常很低。把新页面接进栏目页、相关推荐、面包屑,比反复重传同一个文件更有效。

把 sitemap 当成一份维护良好的清单:地址真实、更新如实、格式规范。它能降低爬虫的探索成本,但无法替页面本身证明价值。

还需要定期清理失效条目:已经 404、已经合并到新地址、已经被设成 noindex 的 URL,及时从文件里移除,让清单与站点现状保持一致,后续的抓取判断才有据可依。