不少站点运营者会默认一件事:把 URL 写进 sitemap 并提交,搜索引擎就会很快收录。实际操作中,sitemap 更多是辅助发现,它告诉蜘蛛“这里有个地址”,但最终是否抓取、是否进入索引,还取决于页面本身和站点整体信号。提交后没动静,先别急着反复提交,按下面顺序核对一遍。
一、先分清“发现”和“收录”
URL 发现是蜘蛛知道这个地址存在;抓取是蜘蛛过来取回内容;收录是内容经过质量判断后进入索引。sitemap 主要作用于第一步。如果页面连抓取都没有,检查发现入口;如果抓取了却没收录,问题通常在页面质量、重复内容或规范选择上。
二、核对 sitemap 里的 URL 是否可正常访问
- 返回状态码是否为 200,而不是 301、302、403、404 或 5xx。
- 是否被 robots.txt 禁止抓取。被屏蔽的 URL 放进 sitemap 通常没有意义。
- 页面是否需要登录、是否依赖 Cookie 或地区限制。蜘蛛拿不到内容,自然无法进一步判断。
- 是否被 noindex 标记。noindex 页面可以提交,但通常不会被保留在索引里。
这些基础项没通过时,sitemap 写得再完整也很难推进到收录阶段。
三、检查 sitemap 自身的常见问题
- 格式与编码:XML 结构是否完整,中文 URL 是否做了正确编码,特殊符号是否转义。
- 数量与体积:单个 sitemap 文件不要塞入过多 URL,超出限制时用索引文件拆分。
- lastmod 是否可信:每次改一点内容就更新时间,会让这个字段失去参考价值。
- 死链和重定向比例:sitemap 里大量 404 或跳转,会降低整体可信度。
- 是否包含不该收录的 URL:标签页、筛选参数页、重复的排序页,不建议无差别提交。
四、发现之后,页面质量决定是否入索引
蜘蛛抓取到页面后,会判断它是否值得保留。常见阻碍包括:正文过薄、模板重复度高、多个 URL 内容高度相似、canonical 指向混乱、页面主要靠 JS 渲染导致正文缺失。sitemap 无法替代这些判断。如果同一批 URL 中大量页面内容雷同,索引可能只保留其中一两个版本。
五、别把 sitemap 当成唯一发现入口
内链仍然是重要的发现路径。一个页面如果只出现在 sitemap 里,站内没有任何链接指向它,抓取优先级通常会偏低。建议在相关栏目、正文或导航中给出合理的入口,锚文本尽量描述页面主题。sitemap 和内链配合,比单独依赖某一种方式更稳妥。
六、按这个顺序排查
- 随机抽取未收录 URL,手动访问,确认状态码和内容正常。
- 查看 robots.txt 和页面 meta robots,排除误屏蔽。
- 检查 sitemap 格式、编码、lastmod 和死链比例。
- 用站内搜索或链接工具确认页面是否有内链入口。
- 对比同批页面,看是否存在重复内容或规范标签冲突。
- 检查页面正文是否可被直接抓取,JS 渲染是否导致空壳。
- 观察服务器日志或抓取统计,确认蜘蛛是否来过。
sitemap 提交只是把地址放到蜘蛛面前,是否收录仍要看页面能否被抓取、内容是否独特、站点结构是否清晰。排查时先解决“能不能发现”,再看“值不值得收录”。
最后提醒一点:不要因为短期没收录就反复删除、重建 sitemap,或批量提交大量低质 URL。保持 sitemap 干净、URL 可访问、内链合理,通常比频繁操作更有帮助。