站点运营

站点运营:Sitemap 维护自查,别让索引文件变成过期清单

Sitemap 是告诉搜索引擎有哪些地址可抓的清单,但它不是提交越多越好。本文从地址有效性、lastmod 写法、分片与体积、与 robots 和规范地址的关系几个角度,整理一份可执行的 Sitemap 维护自查清单,帮助站点减少无效地址暴露,把抓取留给真正需要更新的页面。

站点运营

站点运营:Sitemap 维护自查,别让索引文件变成过期清单

Sitemap 常被当成“提交就能收录”的按钮,但它本质是 URL 发现入口之一。维护得不好,反而会把大量无效地址送到蜘蛛面前,占用本就不多的抓取预算。下面这份自查清单,适合在站点运营中定期执行。

先确认哪些地址不该出现在 Sitemap

  • 返回 404 或 410 的失效地址,已经无法提供内容。
  • 会跳转到其他 URL 的旧地址,最终规范地址才是应该提交的。
  • 带筛选、排序、会话 ID、追踪参数的临时地址,容易拼出大量重复页面。
  • 需要登录、无实质内容或仅为占位页的地址。
  • 被 robots.txt 禁止抓取的地址。既然蜘蛛无法抓取,放在 Sitemap 里只会增加无效发现。

这些地址如果长期留在 Sitemap,会反复出现在抓取队列中,却很难产生有效访问。

lastmod 别写成一个批量刷新的时间

lastmod 是给搜索引擎的提示,不是排名因素。如果每次生成 Sitemap 都把全站时间改成当前时间,蜘蛛很快会降低对这个字段的信任。建议只在页面内容有实质变化时更新,并使用带时区的 W3C 日期格式。

如果全站 lastmod 每天都一模一样,等于告诉搜索引擎“这个字段不用细看”。

分片与体积控制

  • 单个 Sitemap 不超过 50,000 条 URL,未压缩体积不超过 50MB。
  • 大站按栏目或内容类型拆分,再用 Sitemap 索引文件汇总。
  • 分片文件使用稳定命名,不要每天更换地址,避免索引文件频繁失效。
  • 启用 gzip 压缩时,确认服务器返回正确的 Content-Type,避免蜘蛛解压失败。

与 robots.txt、规范地址保持一致

在 robots.txt 中写 Sitemap 地址,方便蜘蛛发现。Sitemap 里的地址应当是最终规范地址:HTTPS、域名正确、没有多余参数、结尾形式统一。不要把重定向前的旧地址放进去,否则会形成“提交—跳转—再抓取”的额外链路。

定期做一次抽样核对

  1. 从 Sitemap 中随机抽取 20 条地址,检查 HTTP 返回码和最终地址。
  2. 查看服务器日志中这些地址的抓取频率、返回状态和响应时间。
  3. 对比 CMS 或数据库中已发布内容的数量,确认差异在合理范围。
  4. 检查 Search Console 或同类平台的 Sitemap 报告,处理“无法抓取”和“已发现但未编入索引”的异常项。

更新节奏与内容发布配合

如果站点每天只更新少量内容,没必要把全量 Sitemap 频繁重写。增量更新或按栏目分片更新,可以减少服务器压力,也让蜘蛛更容易判断哪些部分发生了变化。对新发布页面,保持 Sitemap 同步即可,不必为了“快”而反复提交同一批地址。

小结

Sitemap 不是收录保证,它只是辅助发现的清单。清掉无效地址、把 lastmod 写实、让分片和压缩保持稳定、与 robots 和规范地址对齐,就能减少无效暴露,让抓取更集中到真正有价值的页面上。