網站收錄

站点地图提交後没動静:sitemap 能做什么、不能做什么

提交 sitemap 之後迟迟不见收錄,問题往往不在提交本身。先弄清 sitemap 只能帮助 URL 被發現、提供更新线索,既不保證抓取也不保證收錄,再按訪問狀態、robots 屏蔽、URL 可索引性、規范地址、lastmod 真實度逐項自查,最後回到頁面质量與站内連結。

網站收錄

站点地图提交後没動静:sitemap 能做什么、不能做什么

很多人把 sitemap 当成“提交收錄”的按钮:文件传上去,就等着索引量往上涨。實际用下来會發現,sitemap 只是把 URL 递到搜尋引擎面前,後面抓不抓、收不收,是另一套判断逻辑。搞清楚這條邊界,排查时才不會一直在错誤的地方使劲。

sitemap 真正能帮上忙的三件事

  • 告知 URL 存在。尤其是站内連結少、路径埋得深的頁面,sitemap 是它們被發現的一條补充入口。
  • 提供更新线索。lastmod 寫對了,能让搜尋引擎判断哪些頁面值得重抓,而不是全站轮着来一遍。
  • 批量表達規范地址。同一内容存在多個變体时,sitemap 里只放你希望被索引的那一個,比把所有變体都塞進去更清晰。

注意,這三件事都属于“發現”和“提示”层面,不等于被抓取,更不等于被收錄。

sitemap 做不到的事

它不保證被抓取:抓取要消耗预算,搜尋引擎會按自己的優先級排期。它也不保證被收錄:頁面质量、内容重复度、站点整体情况,都不是一個文件能替你解决的。它同样不能替代内鏈:一個頁面只出現在 sitemap 里、站内没有任何入口,通常比有正常内鏈指向的頁面更难被重视。

把 sitemap 理解為“递交名單”,而不是“入场凭證”。

没動静时,按這個顺序自查

  1. 文件能不能正常訪問。返回 200,不是 404,不是跳轉,也不是被登入墙挡住。
  2. robots.txt 有没有把它拦住。自己屏蔽掉自己的 sitemap,是很常见的低級错誤。
  3. 里面的 URL 是否可抓取。抽查几個,看返回狀態碼、是否被 robots 屏蔽、是否带 noindex。把不可索引的 URL 放進 sitemap,只會稀释這份名單的信号。
  4. 是否混入了非規范地址。带參數的、大小寫不一致的、http 和 https 混着寫的,都應先收敛到统一形式。
  5. lastmod 是否真實。全站每次都是同一個時間戳,等于没寫;批量伪造更新時間,還可能让這個字段失去參考價值。
  6. 數量級是否合理。單個 sitemap 有 URL 數量上限,站点大就拆成多個文件,再用索引文件串起来。

看資料时,分清两個數字

报告里通常會给出“sitemap 中已發現的 URL 數”和“已编入索引的 URL 數”。前者說明名單收到了,後者說明頁面真的進了索引。两者差距很大时,問题多半不在提交环节,而在頁面本身:内容太薄、和其他頁面高度重复,或者站点里這類頁面占比過高。

什么时候该回头做別的

如果 sitemap 狀態正常、抽查的 URL 也能正常抓取,但收錄長期不動,繼續在這個文件上折腾基本没有产出。這时候该看的是:頁面有没有被站内連結指向、内容是否與已有頁面重复、模板頁是不是太多、站点整体抓取是否顺畅。sitemap 解决的是“有没有被發現”,收錄解决的是“值不值得留下”,两件事要分開處理。

一句话總结:sitemap 该做,但它是配角。把 URL 递到门口之後,能不能進门,取决于頁面本身和站点的整体情况。