Sitemap 是告诉搜尋引擎“我有哪些頁面”最直接的手段,但它並不是一個提交完就能忘掉的静態文件。栏目調整、URL 改名、頁面下线、robots 規則變化,都會让几個月前生成的站点地图變得不准确。下面這份自查清單,按從文件本身到内容质量的顺序,帮你把 sitemap 维持在可用狀態。
一、先確認文件本身能打開
很多問题其實卡在第一步:文件压根没被正常讀取。
- 直接訪問站点地图地址,確認返回 200,而不是跳轉到首頁、登入頁或一個 HTML 错誤頁。
- 检查内容類型是否為 XML,而不是被服務器当成普通文本或 HTML 輸出。
- 確認没有被 CDN、防火墙或訪問频率限制挡住——在抓取工具里訪問一次,看看结果是否一致。
- 如果使用了索引文件,逐個打開里面列出的子地图地址,確認每一個都能獨立訪問。
二、里面放的地址要经得起检查
只放可正常訪問的規范地址
301、302 跳轉地址、404 頁面、403 或 5xx 的地址都不该出現在列表里。需要跳轉的,填寫跳轉後的最终地址;已经下线的頁面,從文件中移除,而不是繼續留着等蜘蛛反复碰壁。
與 robots、canonical、noindex 保持一致
如果某個地址在 robots.txt 里被屏蔽,或者頁面本身設定了 noindex,却又被寫進站点地图,這就是自相矛盾的信号。带 canonical 指向別處的頁面,應该收錄被指向的那個地址,而不是目前地址。
地址寫法统一
使用带协议和域名的完整地址,並保持全站一致。同一篇内容不要既出現 http 又出現 https、既带 www 又不带 www,也不要混入參數版本、會话 ID 或临时追踪串。
三、更新與维護的节奏
站点地图的價值取决于它是否跟得上站点的變化。可以按下面几個节点固定動作:
- 新栏目上线後,確認其内容已被收錄進地图;
- 批量修改 URL 或更換域名後,全量重新生成並核對;
- 頁面下线或被合並时,同步刪除對應地址;
- 每季度抽查一次,随机取二三十條地址,確認狀態碼和内容仍然對得上。
關于 lastmod,要真實反映内容改動時間,而不是每次生成都刷新全部時間戳。全都一样的時間等于没有提供任何有效信息。
四、分片與規模
單個文件有數量和体积上限,超過之後應拆分成多個子地图,再用索引文件串联。較大的站点可以按栏目或内容類型拆分,這样某一類頁面出問题时更容易定位。拆分後要確認索引文件里的路径没有寫错,子地图之間也没有重复收錄。
五、提交之後看什么
提交只是開始。要在资源平台的對應入口確認文件是否被成功讀取,並留意讀取的時間和频率是否正常。同时可以對照服務器日誌,看看蜘蛛訪問站点地图的记錄是否稳定,返回狀態是否異常。需要明确的是,站点地图只是辅助發現地址的一種方式,它本身不保證頁面被收錄,也不影响頁面质量评價。
六、常见誤区
- 把全站地址不加区分地全塞進去,包括失效和重复頁面;
- 測試环境、内網地址或占位域名被誤生成進去;
- 頁面地址已经變更,地图里還是舊地址;
- 提交的其實是一個 HTML 頁面而不是 XML 文件;
- 索引文件里引用了不存在的子地图。
把站点地图当成一份需要定期核對的清單,而不是一次性任務:它记錄的不只是“有哪些頁面”,更是你希望蜘蛛優先了解哪些内容。