很多站点把 sitemap 当成收錄開關:提交完就等着頁面進索引。實际上它只是一份线索清單,搜尋引擎可以讀、可以忽略,也可以只挑其中一部分抓。收錄没有動静时,先別急着反复重提交,按下面几個层面逐項核對會更有针對性。
一、先確認文件真的被讀取了
- 直接訪問 sitemap 地址,確認返回 200 且内容是 XML,而不是登入頁、驗證頁或 404。
- robots.txt 中是否声明了 Sitemap 行,路径與真實地址是否一致,包括协议與域名寫法。
- 在站長後台查看 sitemap 的讀取狀態與已收錄條數。若長期顯示無法获取,先解决讀取問题。
- 压缩格式、编碼不一致、手工拼接造成的标簽错誤,都會让解析失敗。
二、sitemap 里的 URL 是否值得抓
线索清單不是越長越好。如果里面混着大量參數頁、篩選頁、空结果頁和深层分頁,整份文件的可信度都會被拉低。
- 只放返回 200 的規范 URL,重定向、404、設定了 noindex 的頁面不必出現在這里。
- 同類低價值頁面收敛數量,優先放有獨立内容、有站内入口的頁面。
- lastmod 應如實反映正文的實质修改,長期未變的頁面不必频繁改時間。
- 同一頁面只保留一種地址形式,避免大小寫、尾斜杠、协议混用。
三、提交方式與規模
文件過大或更新频繁时,拆成多個分片並用索引文件匯總,通常比一份超大文件更容易被稳定讀取。分片不宜過多,也不要把同一批 URL 同时放進多份文件。
频繁重提交並不會加快收錄,反而容易出現“讀取—無變化—再讀取”的循环。合理的更新节奏應当跟随内容實际上线時間,而不是跟随心情。
四、站内入口是否支撑這些 URL
sitemap 解决的是“知道有這些地址”,站内連結解决的是“值不值得抓”。如果某個頁面只存在于 sitemap,站内没有任何頁面指向它,被抓取的優先級通常不高。
- 检查目标頁面距离首頁的点击深度,過深的頁面尽量补上合理入口。
- 確認列表頁、聚合頁、相關推荐是否覆盖到重点 URL。
- 内鏈锚点應指向真實地址,避免中途经過多次跳轉。
- 新頁面上线时同步更新内鏈與 sitemap,两邊時間不要差太久。
建议的核對顺序
- 文件可訪問性與 robots.txt 声明是否一致。
- 讀取狀態與解析错誤是否已排除。
- URL 是否規范、内容是否具备被抓的理由。
- 分片數量與 lastmod 是否合理。
- 站内入口與点击深度是否支撑這些地址。
- 提交後观察一段時間的抓取與索引變化,再决定是否調整。
提示:sitemap 處理的是“發現”环节,收錄還要看内容质量、重复情况和抓取安排。發現之後没抓取、抓了没入選,是另外的問题,需要分開排查,不要都算到 sitemap 头上。