Sitemap 常被当成“提交就能收錄”的按钮,但它本质是 URL 發現入口之一。维護得不好,反而會把大量無效地址送到蜘蛛面前,占用本就不多的抓取预算。下面這份自查清單,适合在站点运营中定期执行。
先確認哪些地址不该出現在 Sitemap
- 返回 404 或 410 的失效地址,已经無法提供内容。
- 會跳轉到其他 URL 的舊地址,最终規范地址才是應该提交的。
- 带篩選、排序、會话 ID、追踪參數的临时地址,容易拼出大量重复頁面。
- 需要登入、無實质内容或僅為占位頁的地址。
- 被 robots.txt 禁止抓取的地址。既然蜘蛛無法抓取,放在 Sitemap 里只會增加無效發現。
這些地址如果長期留在 Sitemap,會反复出現在抓取队列中,却很难产生有效訪問。
lastmod 別寫成一個批量刷新的時間
lastmod 是给搜尋引擎的提示,不是排名因素。如果每次生成 Sitemap 都把全站時間改成目前時間,蜘蛛很快會降低對這個字段的信任。建议只在頁面内容有實质變化时更新,並使用带时区的 W3C 日期格式。
如果全站 lastmod 每天都一模一样,等于告诉搜尋引擎“這個字段不用细看”。
分片與体积控制
- 單個 Sitemap 不超過 50,000 條 URL,未压缩体积不超過 50MB。
- 大站按栏目或内容類型拆分,再用 Sitemap 索引文件匯總。
- 分片文件使用稳定命名,不要每天更換地址,避免索引文件频繁失效。
- 啟用 gzip 压缩时,確認服務器返回正确的 Content-Type,避免蜘蛛解压失敗。
與 robots.txt、規范地址保持一致
在 robots.txt 中寫 Sitemap 地址,方便蜘蛛發現。Sitemap 里的地址應当是最终規范地址:HTTPS、域名正确、没有多余參數、结尾形式统一。不要把重定向前的舊地址放進去,否則會形成“提交—跳轉—再抓取”的額外鏈路。
定期做一次抽样核對
- 從 Sitemap 中随机抽取 20 條地址,检查 HTTP 返回碼和最终地址。
- 查看服務器日誌中這些地址的抓取频率、返回狀態和响應時間。
- 對比 CMS 或資料库中已發布内容的數量,確認差异在合理范围。
- 检查 Search Console 或同類平台的 Sitemap 报告,處理“無法抓取”和“已發現但未编入索引”的異常項。
更新节奏與内容發布配合
如果站点每天只更新少量内容,没必要把全量 Sitemap 频繁重寫。增量更新或按栏目分片更新,可以减少服務器压力,也让蜘蛛更容易判断哪些部分發生了變化。對新發布頁面,保持 Sitemap 同步即可,不必為了“快”而反复提交同一批地址。
小结
Sitemap 不是收錄保證,它只是辅助發現的清單。清掉無效地址、把 lastmod 寫實、让分片和压缩保持稳定、與 robots 和規范地址對齐,就能减少無效暴露,让抓取更集中到真正有價值的頁面上。