網站收錄

sitemap 不是提交一次就完事:lastmod、分片和失效地址的维護节奏

sitemap 提交之後常被搁置,但它其實需要持續维護。本文從 lastmod 怎么寫、分片與索引文件怎么组织、失效地址如何清理、提交後该看哪些反馈几個方面,說明怎样让這份清單保持准确,並分清“被發現”和“被收錄”這两件事。

網站收錄

sitemap 不是提交一次就完事:lastmod、分片和失效地址的维護节奏

很多站点把 sitemap 当成一次性的動作:上线时生成一份,扔進搜尋资源平台,之後再没打開過。實际上它更像一份需要持續维護的候選清單,它告诉搜尋引擎“這些地址值得来抓”,但既不保證抓取,也不保證收錄。清單维護得越准,作為參考的價值越高;混進太多噪声,反而會稀释信号。

sitemap 只是候選清單

它解决的是“發現”問题,不解决“索引”問题。地址寫進去,只代表你希望它被看到。能否被抓、抓了之後是否進索引,取决于 robots 規則、服務器可訪問性、頁面本身的质量,以及它與其他地址之間的關系。把 sitemap 理解成“给爬虫的一份目錄”,比理解成“收錄開關”更接近事實。

lastmod:寫真實修改時間,別批量刷

  • 只在正文有實质變化时更新;改模板、改頁脚、改導航不算内容更新。
  • 不要每次构建都寫入目前時間,全站時間戳整齐划一反而是異常信号。
  • 時間格式统一(常用 ISO 8601 並带时区),別在同一份文件里混用多種寫法。
  • 長期不更新的老頁面可以保留在清單里,但不必為了“顯得活跃”而人為改動時間。

規模上来後:分片與索引文件

單個 sitemap 文件有地址數量與体积上限(常见是 5 萬條 URL、未压缩 50MB 量級),超過就要拆成多個文件,再用一個 sitemap index 文件把它們串起来。

  • 按栏目或頁面類型分片,出問题时能快速定位是哪一批地址。
  • 分片文件地址保持稳定,別频繁改名或換路径。
  • 每個文件都要是有效 XML,编碼声明正确,地址里的 & 等特殊字符要轉义。

失效地址要及时摘掉

清單里長期挂着大量 404、410 或已被 noindex 的地址,會让這份目錄的可信度下降,排查問题时也被噪声干扰。

  • 返回 404、410 的地址:確認下线後直接從 sitemap 移除。
  • 做過 301 的地址:寫跳轉後的目标地址,別把舊地址留在里面。
  • 被 noindex 或 robots 屏蔽的地址:不要出現在 sitemap 里,两邊信号互相矛盾。

提交之後盯哪些反馈

提交後首先要看的是“有没有被抓”,而不是“有没有被收錄”。平台里的 sitemap 报告一般會给出已提交地址數、被發現的地址數、抓取情况,這些數字反映的是你给的清單有没有被讀到、被處理,與最终索引狀態是两件事。

  • 已發現數遠低于已提交數:先检查文件格式、地址可訪問性、分片是否都挂進了索引文件。
  • 有抓取但長期不入索引:問题多半在頁面本身,不在 sitemap。
  • 观察周期按周看,不必几小时刷一次,短時間的波動說明不了什么。

几個常见誤区

  1. 把 sitemap 当成收錄保證,提交完就等结果。
  2. 把全站 lastmod 统一改成当天,指望這样能催快抓取。
  3. 把所有篩選頁、排序頁、带參數的地址一並塞進去,让清單里大半是低價值地址。
  4. 只放首頁和栏目頁,深层内容全靠内鏈慢慢被發現。
  5. 站点調整後新舊地址同时存在,清單里两份都留着。
sitemap 的價值在于准确,不在于多。清單越干净,越接近站点真正希望被索引的那批地址。