先把站点地图的定位摆正
站点地图(sitemap)的作用是把希望被發現的 URL 集中列出来,让搜尋引擎更省力地找到入口。它不承诺收錄,也不等于给頁面加權。提交之後收錄没有變化,多數时候不是“没提交成功”,而是列表里的 URL 本身不适合進索引,或者文件压根没被正常讀取。
第一步:文件本身能不能被正常讀取
- 直接在浏览器打開地址,確認返回 200,而不是 404、301 或跳到登入頁。
- XML 格式要合法,标簽閉合、命名空間正确,编碼统一為 UTF-8。
- 單個文件不要超過 5 萬條 URL、未压缩体积不超過 50MB;超出就拆成多個文件,再用 sitemap index 匯總。
- 在 robots.txt 里用 Sitemap: 声明完整地址,文件不在根目錄时尤其要寫全。
- 如果整站被 robots.txt 屏蔽,列表里的地址同样抓不到,先核對屏蔽規則有没有誤伤。
第二步:列表里放的是不是该被收錄的 URL
站点地图是“我希望進索引”的清單,不是全站 URL 备份。把不该收錄的地址混進去,只會浪費抓取,還會让狀態报告變得难讀。
- 只放返回 200 且允许索引的頁面,带 noindex 的頁面不要放。
- canonical 指向別處的重复版本不要放,放你要保留的那一個。
- 301、302 跳轉地址,參數排序产生的组合頁,带會话 ID 的連結,都不要放。
- 分頁頁碼、篩選排序頁按站点策略决定,通常只保留規范化後的主鏈。
- 已下架或已刪除的頁面及时移除,不要長期留在列表里。
第三步:lastmod 這類字段怎么寫才有意义
lastmod 只在内容确實有實质更新时才改。批量刷時間戳、每天自動更新成目前時間,會让這個信号失去參考價值,抓取方可能對你的時間字段整体打折。changefreq 和 priority 早已不是主要依據,不必花力气調。
第四步:提交之後看什么反馈
- 在站長工具里確認站点地图狀態是“成功”而不是“無法讀取”,並记下讀取到的 URL 數量。
- 把讀取數量和自己文件里的條數對一遍,差距大說明文件被截断或格式有問题。
- 看頁面狀態报告:是“已發現未抓取”還是“已抓取未编入索引”,這两個方向的處理方式不同。
- 對照服務器日誌,確認抓取請求确實落在列表里列出的地址上,而不是只抓了首頁和内鏈。
补充一句:站点地图解决的是“發現”,索引與否取决于頁面质量、重复程度和站点整体信任,別把收錄問题全压在文件上。
一份可执行的核對顺序
按這個顺序走一遍:文件能否正常打開 → 格式與体积是否合規 → robots.txt 有没有誤屏 → 列表内 URL 是否都是 200 且允许索引 → lastmod 是否真實 → 站長工具讀取數量是否與文件一致 → 再回到頁面自身看内容厚度與重复度。
多數“提交了没動静”的情况,停在前面几步就能找到原因:文件讀不進去,或者列表里塞了太多本来就不该進索引的地址。