網站收錄

站点地图在收錄里的真實作用:该放什么、多久更新一次

站点地图常被当成“提交就收錄”的開關,其實它只负责让搜尋引擎更快發現 URL。本文讲清 sitemap 该收錄哪些干净地址、哪些 URL 應当排除、文件拆分與体量限制、lastmod 的正确填法,以及在 sitemap 正常但頁面迟迟不被收錄时,應该按什么顺序排查問题。

網站收錄

站点地图在收錄里的真實作用:该放什么、多久更新一次

很多站点把 sitemap 当作“提交就能收錄”的開關,實际不是。它做的事情只有两件:告诉搜尋引擎有哪些 URL 存在,以及這些 URL 大概什么时候變過。至于抓不抓、收不收,取决于頁面本身的质量、站点整体抓取情况以及搜尋引擎自己的判断。把 sitemap 做對,收益是让 URL 發現更快更稳;做错了,會白白占用抓取资源。

sitemap 的定位:URL 發現,不是收錄開關

搜尋引擎發現 URL 的路径有很多:内鏈、外鏈、主動提交、sitemap、日誌中暴露的地址等。sitemap 只是其中一條,而且是补充性质的一條。一個頁面如果没有任何内鏈入口,只靠 sitemap 被發現,即使被抓取,通常也很难有像样的收錄表現,因為它缺少站内權重與上下文。

所以合理的顺序是:先把站内連結结构理顺,再用 sitemap 把重要 URL 匯總一遍,而不是反過来指望 sitemap 解决收錄問题。

该放哪些 URL

  • 返回 200、允许被抓取、允许被索引的規范地址(canonical 指向自身的那一個)。
  • 你希望出現在搜尋结果里的頁面:栏目頁、内容頁、必要的列表頁。
  • URL 用绝對地址,带上协议和域名,特殊字符按規范轉义。

哪些 URL 不该放

  • 被 robots.txt 屏蔽的地址,放進去只會制造冲突,蜘蛛拿不到内容。
  • 标了 noindex 的頁面,既然不想让它進索引,就没有必要再放進 sitemap。
  • 會跳轉的地址、404 頁面、參數组合生成的重复 URL、带會话 ID 的地址。
  • 篩選、排序以及分頁深處那些没有獨立價值的頁面。

简單说,sitemap 里最好只出現干净的、最终形態的、你愿意让人看到的 URL。每多放一條低價值地址,就多占一份抓取预算。

体量、拆分與格式

單個 sitemap 文件最多 5 萬條 URL,未压缩体积不超過 50MB。超過就拆成多個文件,再用 sitemap index 匯總。常见做法是按類型拆:文章、商品、栏目各一個,方便分別观察和排查。拆分之後,某一類型出問题,影响面也小一些。

格式上注意 XML 结构完整、编碼正确、時間格式符合要求。不同生成工具寫错字段名的情况並不少见,出問题时應先驗證一遍 XML 本身。

lastmod 怎么填才有意义

lastmod 只在頁面内容真的變動时才更新。很多站点每次生成 sitemap 就把全部 URL 的時間刷成当下,這會让這個字段彻底失去參考價值,搜尋引擎也會逐渐忽略它。

更稳妥的做法是:只更新真正改過内容的頁面,時間精确到天或秒都可以,但不要無意义地全量刷新。頁面只改了错別字、調整了样式,通常不值得改 lastmod。

更新與提交的节奏

内容更新频繁的站点,sitemap 可以定期重新生成,例如每天或每周;更新不频繁的,按需更新即可。提交之後不要反复重提同一個文件,没有新增内容时重提几乎没有意义。新站或新栏目上线时,配合内鏈一起做,比單獨提交更實在。

sitemap 正常但頁面不收錄,先看什么

  1. 這個 URL 在 sitemap 里是不是規范地址,有没有和其他地址重复。
  2. 頁面返回的是 200 吗,有没有被 robots 規則或 noindex 拦住。
  3. 頁面在站内有没有入口,是不是只有 sitemap 這一條路。
  4. 内容是否與其他頁面高度重复,或者篇幅明顯不足。
  5. 蜘蛛近期有没有真的抓過它,抓取结果是什么。

顺着這個顺序看,大部分問题能定位到具体环节,而不是笼统地归因于“提交没用”。

把 sitemap 当成一張给蜘蛛看的清單:只列值得看的地址,只在内容變化时更新,其余交给頁面质量去决定。