很多站点把 sitemap 当成收录开关:提交完就等着页面进索引。实际上它只是一份线索清单,搜索引擎可以读、可以忽略,也可以只挑其中一部分抓。收录没有动静时,先别急着反复重提交,按下面几个层面逐项核对会更有针对性。
一、先确认文件真的被读取了
- 直接访问 sitemap 地址,确认返回 200 且内容是 XML,而不是登录页、验证页或 404。
- robots.txt 中是否声明了 Sitemap 行,路径与真实地址是否一致,包括协议与域名写法。
- 在站长后台查看 sitemap 的读取状态与已收录条数。若长期显示无法获取,先解决读取问题。
- 压缩格式、编码不一致、手工拼接造成的标签错误,都会让解析失败。
二、sitemap 里的 URL 是否值得抓
线索清单不是越长越好。如果里面混着大量参数页、筛选页、空结果页和深层分页,整份文件的可信度都会被拉低。
- 只放返回 200 的规范 URL,重定向、404、设置了 noindex 的页面不必出现在这里。
- 同类低价值页面收敛数量,优先放有独立内容、有站内入口的页面。
- lastmod 应如实反映正文的实质修改,长期未变的页面不必频繁改时间。
- 同一页面只保留一种地址形式,避免大小写、尾斜杠、协议混用。
三、提交方式与规模
文件过大或更新频繁时,拆成多个分片并用索引文件汇总,通常比一份超大文件更容易被稳定读取。分片不宜过多,也不要把同一批 URL 同时放进多份文件。
频繁重提交并不会加快收录,反而容易出现“读取—无变化—再读取”的循环。合理的更新节奏应当跟随内容实际上线时间,而不是跟随心情。
四、站内入口是否支撑这些 URL
sitemap 解决的是“知道有这些地址”,站内链接解决的是“值不值得抓”。如果某个页面只存在于 sitemap,站内没有任何页面指向它,被抓取的优先级通常不高。
- 检查目标页面距离首页的点击深度,过深的页面尽量补上合理入口。
- 确认列表页、聚合页、相关推荐是否覆盖到重点 URL。
- 内链锚点应指向真实地址,避免中途经过多次跳转。
- 新页面上线时同步更新内链与 sitemap,两边时间不要差太久。
建议的核对顺序
- 文件可访问性与 robots.txt 声明是否一致。
- 读取状态与解析错误是否已排除。
- URL 是否规范、内容是否具备被抓的理由。
- 分片数量与 lastmod 是否合理。
- 站内入口与点击深度是否支撑这些地址。
- 提交后观察一段时间的抓取与索引变化,再决定是否调整。
提示:sitemap 处理的是“发现”环节,收录还要看内容质量、重复情况和抓取安排。发现之后没抓取、抓了没入选,是另外的问题,需要分开排查,不要都算到 sitemap 头上。