網站收錄

提交了 sitemap 還是收錄慢:站点地图能做什么、不能做什么

站点地图常被当成提交即收錄的開關,實际上它只是 URL 發現的补充来源。本文說明 sitemap 的作用邊界、一份能被正常處理的清單该满足哪些條件、lastmod 為何不能乱寫,以及提交後仍不收錄时應按抓取、响應、内容、索引、展示的顺序逐层排查,並解释為什么内鏈比反复重传文件更有效。

網站收錄

提交了 sitemap 還是收錄慢:站点地图能做什么、不能做什么

很多站長把 sitemap 当成“提交就能收錄”的開關:文件传上去,後台顯示成功,然後開始等索引。几天過去,新頁面還在原地。問题往往不在提交動作本身,而在于對站点地图的定位有偏差。它是一份“我這里有這些地址”的声明,不是加速收錄的按钮。

sitemap 的作用邊界

搜尋引擎把 sitemap 当作 URL 發現的补充来源之一,主要解决两件事:让新頁面更快進入待抓取队列,以及為已收錄頁面提供 lastmod 之類的更新參考。但它不决定抓取频次,也不决定頁面是否值得進索引。後两個判断由内容质量、服務器响應、站点整体情况、内鏈结构共同影响。所以一份格式完美、地址齐全的 sitemap,也可能带来零收錄增長。

一份能被正常處理的 sitemap

  • 只放規范地址:协议、域名前缀保持一致,不带跟踪參數、不带會话 ID。
  • 只放返回 200 且允许索引的頁面:noindex、需登入、被 robots 屏蔽的地址不要寫進去。
  • 單文件不超過 5 萬條、50MB,超出就分片,並用一個索引文件串起来。
  • 编碼用 UTF-8,地址做好轉义,不要夹带 HTML 或脚本内容。
  • 在 robots.txt 里寫明 Sitemap 位置,方便爬虫顺路取用。

lastmod 寫错比不寫更糟

lastmod 是爬虫判断“這個頁面是否真的變了”的依據。如果每次部署都批量刷新時間戳,而正文没有任何改動,爬虫几次下来就會發現這個字段不可信,之後不再參考。只在该頁面内容确實修改时更新,使用标准日期格式,精确到天通常就够。

提交了仍然不收錄,按這個顺序查

  1. 抓取层面:查看訪問日誌或後台資料,確認爬虫有没有来過。没来,說明站内入口太弱,sitemap 只是一條候選线索。
  2. 响應层面:抓取时是否频繁超时、返回 5xx,或者對爬虫的限速過嚴。
  3. 内容层面:頁面是否有足够的獨立信息,還是模板拼出来的空壳;同主题是否存在多個近似版本互相稀释。
  4. 索引层面:確認頁面没有 noindex,canonical 没有指向別處,也没有被 robots 挡在抓取之外。
  5. 展示层面:如果已经進了索引却搜不到關鍵詞,那属于可见性與竞争問题,和 sitemap 基本無關。

sitemap 替代不了内鏈

sitemap 提供的是“存在性”,内鏈提供的是“重要性與上下文”。一個只能從 sitemap 找到、站内没有任何入口的頁面,抓取频次通常很低。把新頁面接進栏目頁、相關推荐、面包屑,比反复重传同一個文件更有效。

把 sitemap 当成一份维護良好的清單:地址真實、更新如實、格式規范。它能降低爬虫的探索成本,但無法替頁面本身證明價值。

還需要定期清理失效條目:已经 404、已经合並到新地址、已经被设成 noindex 的 URL,及时從文件里移除,让清單與站点現状保持一致,後續的抓取判断才有據可依。