Sitemap 常被当成“提交就能收录”的按钮,但它本质是 URL 发现入口之一。维护得不好,反而会把大量无效地址送到蜘蛛面前,占用本就不多的抓取预算。下面这份自查清单,适合在站点运营中定期执行。
先确认哪些地址不该出现在 Sitemap
- 返回 404 或 410 的失效地址,已经无法提供内容。
- 会跳转到其他 URL 的旧地址,最终规范地址才是应该提交的。
- 带筛选、排序、会话 ID、追踪参数的临时地址,容易拼出大量重复页面。
- 需要登录、无实质内容或仅为占位页的地址。
- 被 robots.txt 禁止抓取的地址。既然蜘蛛无法抓取,放在 Sitemap 里只会增加无效发现。
这些地址如果长期留在 Sitemap,会反复出现在抓取队列中,却很难产生有效访问。
lastmod 别写成一个批量刷新的时间
lastmod 是给搜索引擎的提示,不是排名因素。如果每次生成 Sitemap 都把全站时间改成当前时间,蜘蛛很快会降低对这个字段的信任。建议只在页面内容有实质变化时更新,并使用带时区的 W3C 日期格式。
如果全站 lastmod 每天都一模一样,等于告诉搜索引擎“这个字段不用细看”。
分片与体积控制
- 单个 Sitemap 不超过 50,000 条 URL,未压缩体积不超过 50MB。
- 大站按栏目或内容类型拆分,再用 Sitemap 索引文件汇总。
- 分片文件使用稳定命名,不要每天更换地址,避免索引文件频繁失效。
- 启用 gzip 压缩时,确认服务器返回正确的 Content-Type,避免蜘蛛解压失败。
与 robots.txt、规范地址保持一致
在 robots.txt 中写 Sitemap 地址,方便蜘蛛发现。Sitemap 里的地址应当是最终规范地址:HTTPS、域名正确、没有多余参数、结尾形式统一。不要把重定向前的旧地址放进去,否则会形成“提交—跳转—再抓取”的额外链路。
定期做一次抽样核对
- 从 Sitemap 中随机抽取 20 条地址,检查 HTTP 返回码和最终地址。
- 查看服务器日志中这些地址的抓取频率、返回状态和响应时间。
- 对比 CMS 或数据库中已发布内容的数量,确认差异在合理范围。
- 检查 Search Console 或同类平台的 Sitemap 报告,处理“无法抓取”和“已发现但未编入索引”的异常项。
更新节奏与内容发布配合
如果站点每天只更新少量内容,没必要把全量 Sitemap 频繁重写。增量更新或按栏目分片更新,可以减少服务器压力,也让蜘蛛更容易判断哪些部分发生了变化。对新发布页面,保持 Sitemap 同步即可,不必为了“快”而反复提交同一批地址。
小结
Sitemap 不是收录保证,它只是辅助发现的清单。清掉无效地址、把 lastmod 写实、让分片和压缩保持稳定、与 robots 和规范地址对齐,就能减少无效暴露,让抓取更集中到真正有价值的页面上。