Sitemap 是告诉搜索引擎“我有哪些页面”最直接的手段,但它并不是一个提交完就能忘掉的静态文件。栏目调整、URL 改名、页面下线、robots 规则变化,都会让几个月前生成的站点地图变得不准确。下面这份自查清单,按从文件本身到内容质量的顺序,帮你把 sitemap 维持在可用状态。
一、先确认文件本身能打开
很多问题其实卡在第一步:文件压根没被正常读取。
- 直接访问站点地图地址,确认返回 200,而不是跳转到首页、登录页或一个 HTML 错误页。
- 检查内容类型是否为 XML,而不是被服务器当成普通文本或 HTML 输出。
- 确认没有被 CDN、防火墙或访问频率限制挡住——在抓取工具里访问一次,看看结果是否一致。
- 如果使用了索引文件,逐个打开里面列出的子地图地址,确认每一个都能独立访问。
二、里面放的地址要经得起检查
只放可正常访问的规范地址
301、302 跳转地址、404 页面、403 或 5xx 的地址都不该出现在列表里。需要跳转的,填写跳转后的最终地址;已经下线的页面,从文件中移除,而不是继续留着等蜘蛛反复碰壁。
与 robots、canonical、noindex 保持一致
如果某个地址在 robots.txt 里被屏蔽,或者页面本身设置了 noindex,却又被写进站点地图,这就是自相矛盾的信号。带 canonical 指向别处的页面,应该收录被指向的那个地址,而不是当前地址。
地址写法统一
使用带协议和域名的完整地址,并保持全站一致。同一篇内容不要既出现 http 又出现 https、既带 www 又不带 www,也不要混入参数版本、会话 ID 或临时追踪串。
三、更新与维护的节奏
站点地图的价值取决于它是否跟得上站点的变化。可以按下面几个节点固定动作:
- 新栏目上线后,确认其内容已被收录进地图;
- 批量修改 URL 或更换域名后,全量重新生成并核对;
- 页面下线或被合并时,同步删除对应地址;
- 每季度抽查一次,随机取二三十条地址,确认状态码和内容仍然对得上。
关于 lastmod,要真实反映内容改动时间,而不是每次生成都刷新全部时间戳。全都一样的时间等于没有提供任何有效信息。
四、分片与规模
单个文件有数量和体积上限,超过之后应拆分成多个子地图,再用索引文件串联。较大的站点可以按栏目或内容类型拆分,这样某一类页面出问题时更容易定位。拆分后要确认索引文件里的路径没有写错,子地图之间也没有重复收录。
五、提交之后看什么
提交只是开始。要在资源平台的对应入口确认文件是否被成功读取,并留意读取的时间和频率是否正常。同时可以对照服务器日志,看看蜘蛛访问站点地图的记录是否稳定,返回状态是否异常。需要明确的是,站点地图只是辅助发现地址的一种方式,它本身不保证页面被收录,也不影响页面质量评价。
六、常见误区
- 把全站地址不加区分地全塞进去,包括失效和重复页面;
- 测试环境、内网地址或占位域名被误生成进去;
- 页面地址已经变更,地图里还是旧地址;
- 提交的其实是一个 HTML 页面而不是 XML 文件;
- 索引文件里引用了不存在的子地图。
把站点地图当成一份需要定期核对的清单,而不是一次性任务:它记录的不只是“有哪些页面”,更是你希望蜘蛛优先了解哪些内容。