很多站长把站点地图(sitemap)当成收录的开关,以为文件一提交,页面就会陆续进索引。实际用下来常常是:文件状态正常,后台也显示已读取,但页面收录量没什么变化。这不是 sitemap 失效,而是它的作用被高估了——它只解决“告诉蜘蛛这里有这些地址”,不解决“这些地址值不值得收录”。
sitemap 到底能做什么
从搜索引擎公开的说明看,站点地图主要帮助发现 URL,尤其在以下情况更有价值:站点外链少、内链结构弱、页面藏在较深层级、新站刚上线还没有被抓取路径。它是一个补充线索,而不是收录的决定因素。真正的决定因素仍然是页面的可访问性、内容质量和站点整体情况。
把 sitemap 看成路牌,不是入场券。路牌能让人知道你在这,能不能进场是另一套判断。
提交没动静时,先排查这几处
- 文件本身能否正常访问:返回 200,不是重定向到登录页或首页,Content-Type 是 XML(或 txt),没有因为服务器规则被拦。
- 地址是否写对:必须是完整的绝对地址,包含协议;编码、大小写、域名要与当前站点一致。
- 是否在 robots.txt 里声明:加上 Sitemap 指令可以被更稳定地发现,尤其是子目录站点。
- lastmod 是否真实:为了催收录而每次抓取都刷新时间戳,反而会让这个字段失去参考价值。
- 里面是不是混了不该放的地址:被 robots.txt 屏蔽的、加 noindex 的、重定向的、404 的、参数重复的页面,都不该出现在站点地图里。放了不但没有帮助,还会稀释文件中有效地址的比例。
- 分片与索引文件:单文件地址数超过 5 万或体积超过 50MB,需要拆分成多个文件并用索引文件引用。
- 是否只提交给了单一搜索引擎:不同搜索引擎各有自己的提交入口,只提交一家,别的不会自动读到。
站点地图里该放什么,不该放什么
判断标准可以简化为一句话:只放返回 200、可被抓取、且自身就是规范版本的页面。规范 URL 指的是页面 canonical 指向自己,而不是别的地址。对应地,下面这些类型建议排除:
- 分页的第 2、3 页(除非你确实希望它们被单独索引)
- 站内搜索结果页、筛选排序页
- 标签、归档这类自动聚合页——除非内容确实有独立价值
- 需要登录或表单提交后才能看到的地址
文件越干净,搜索引擎处理它的效率通常越高。塞进大量低价值地址,不会换来更多收录,只会让真正重要的地址淹没在里面。
让站点地图真正发挥作用,需要配合的动作
- 保证页面本身能被抓取:没有意外的 robots 屏蔽、没有被 CDN 或防火墙挡住蜘蛛、服务端不频繁超时。
- 用内链形成到达路径:sitemap 提供的是扁平列表,内链提供的是上下文。蜘蛛顺着链接一层层抓下去,对页面的理解通常比单看列表更充分。
- 页面有独特内容:模板化、正文极短的页面,即使被发现,也常常停在“已抓取,未编入索引”。
- 更新后同步刷新 sitemap:新增页面及时加入,已删除或改地址的及时移除,避免长期指向失效地址。
- 用日志和报告验证效果:先在服务器日志里确认蜘蛛确实抓取了 sitemap 文件,再去看站点的抓取统计。如果连文件都没被取走,问题就在文件或声明这一步;如果文件被反复读取但页面收录仍无变化,问题多半在页面质量与站点层面。
什么时候它帮不上忙
站点已经结构清晰、内链完整、蜘蛛抓取频繁时,sitemap 带来的增量往往很小,它的价值更多是兜底:防止孤立页面被漏掉。反过来,如果站点存在大量重复内容、页面质量普遍偏低、URL 规范混乱,那么再怎么优化 sitemap,收录也很难有好转——这些属于站点层面的问题,不是提交动作能解决的。
所以遇到提交了没动静,比较有效的顺序是:先确认文件与声明没有问题,再确认蜘蛛确实读过,最后把注意力放回页面本身——能不能访问、是否规范、有没有值得收录的内容。前两步通常很快能查完,真正花时间的是第三步。