不少站点运营者會預設一件事:把 URL 寫進 sitemap 並提交,搜尋引擎就會很快收錄。實际操作中,sitemap 更多是辅助發現,它告诉蜘蛛“這里有個地址”,但最终是否抓取、是否進入索引,還取决于頁面本身和站点整体信号。提交後没動静,先別急着反复提交,按下面顺序核對一遍。
一、先分清“發現”和“收錄”
URL 發現是蜘蛛知道這個地址存在;抓取是蜘蛛過来取回内容;收錄是内容经過质量判断後進入索引。sitemap 主要作用于第一步。如果頁面连抓取都没有,检查發現入口;如果抓取了却没收錄,問题通常在頁面质量、重复内容或規范選擇上。
二、核對 sitemap 里的 URL 是否可正常訪問
- 返回狀態碼是否為 200,而不是 301、302、403、404 或 5xx。
- 是否被 robots.txt 禁止抓取。被屏蔽的 URL 放進 sitemap 通常没有意义。
- 頁面是否需要登入、是否依赖 Cookie 或地区限制。蜘蛛拿不到内容,自然無法進一步判断。
- 是否被 noindex 标记。noindex 頁面可以提交,但通常不會被保留在索引里。
這些基础項没通過时,sitemap 寫得再完整也很难推進到收錄阶段。
三、检查 sitemap 自身的常见問题
- 格式與编碼:XML 结构是否完整,中文 URL 是否做了正确编碼,特殊符号是否轉义。
- 數量與体积:單個 sitemap 文件不要塞入過多 URL,超出限制时用索引文件拆分。
- lastmod 是否可信:每次改一点内容就更新時間,會让這個字段失去參考價值。
- 死鏈和重定向比例:sitemap 里大量 404 或跳轉,會降低整体可信度。
- 是否包含不该收錄的 URL:标簽頁、篩選參數頁、重复的排序頁,不建议無差別提交。
四、發現之後,頁面质量决定是否入索引
蜘蛛抓取到頁面後,會判断它是否值得保留。常见阻碍包括:正文過薄、模板重复度高、多個 URL 内容高度相似、canonical 指向混乱、頁面主要靠 JS 渲染導致正文缺失。sitemap 無法替代這些判断。如果同一批 URL 中大量頁面内容雷同,索引可能只保留其中一两個版本。
五、別把 sitemap 当成唯一發現入口
内鏈仍然是重要的發現路径。一個頁面如果只出現在 sitemap 里,站内没有任何連結指向它,抓取優先級通常會偏低。建议在相關栏目、正文或導航中给出合理的入口,锚文本尽量描述頁面主题。sitemap 和内鏈配合,比單獨依赖某一種方式更稳妥。
六、按這個顺序排查
- 随机抽取未收錄 URL,手動訪問,確認狀態碼和内容正常。
- 查看 robots.txt 和頁面 meta robots,排除誤屏蔽。
- 检查 sitemap 格式、编碼、lastmod 和死鏈比例。
- 用站内搜尋或連結工具確認頁面是否有内鏈入口。
- 對比同批頁面,看是否存在重复内容或規范标簽冲突。
- 检查頁面正文是否可被直接抓取,JS 渲染是否導致空壳。
- 观察服務器日誌或抓取統計,確認蜘蛛是否来過。
sitemap 提交只是把地址放到蜘蛛面前,是否收錄仍要看頁面能否被抓取、内容是否獨特、站点结构是否清晰。排查时先解决“能不能發現”,再看“值不值得收錄”。
最後提醒一点:不要因為短期没收錄就反复刪除、重建 sitemap,或批量提交大量低质 URL。保持 sitemap 干净、URL 可訪問、内鏈合理,通常比频繁操作更有帮助。