網站收錄

sitemap 不是收錄開關:它只负责把 URL 送到蜘蛛面前

文章梳理 sitemap 在收錄流程中的真實位置:它只解决 URL 發現問题,既不决定抓取優先級,也不决定頁面是否被收錄。文中說明哪些 URL 适合放進 sitemap、lastmod 與分片的常见誤区,以及怎么用日誌和覆盖率报告判断 sitemap 是否真的被蜘蛛讀取和使用。

網站收錄

sitemap 不是收錄開關:它只负责把 URL 送到蜘蛛面前

收錄不理想时,很多站点的第一反應是“再生成一份 sitemap 提交上去”。sitemap 确實有用,但它解决的問题很有限:它只负责把 URL 摆到蜘蛛面前,後面的抓取、解析、质量判断、進入索引,它都插不上手。把它当成收錄開關,容易白忙一场。

sitemap 能做什么,不能做什么

  • 能做:一次性告知大量 URL,尤其是内鏈稀疏、层級很深、刚上线的頁面。
  • 不能做:把某個 URL 的抓取優先級提到“必抓”,也不能决定它是否被收錄。
  • 實际情况:它是一份候選清單,蜘蛛仍然按自己的节奏挑着抓。

哪些 URL 值得放進去

判断标准其實很简單:這個 URL 單獨拿出来,是否是一個正常、可索引的頁面。

  • 返回 200,canonical 指向自己;
  • 没有被 robots.txt 屏蔽,也没有 noindex;
  • 是正文頁或有效列表頁,不是篩選组合、會话參數、排序副本;
  • 已经 301 的舊地址,放新地址,不要新舊都放。

把重定向、404、參數頁塞進文件,只會浪費抓取机會,還可能让蜘蛛對整份文件的信任度下降。

几個容易忽略的细节

  • lastmod 要真實。每次生成都刷成目前時間,等于告诉蜘蛛“這頁天天變”,几次之後它就不信了。
  • 用绝對地址,並且和主域、协议保持一致。
  • 數量大时分片,再用 sitemap 索引文件串起来;單個文件有 5 萬條、50MB 的上限。
  • 在 robots.txt 里声明地址,同时到搜尋资源平台提交,两條路都走。
  • sitemap 文件本身要能稳定訪問,別让它返回 500 或者超时。

URL 發現不只靠 sitemap

sitemap 是补充通道,主力仍然是站内連結。列表頁、導航、面包屑、相關推荐上的可点击連結,蜘蛛顺着走一遍就能覆盖大部分頁面。外部連結、蜘蛛池這類手段,本质也是让 URL 出現在更多可被抓取的路径上。如果站内本身就是孤岛结构,sitemap 里再堆 URL,也只是清單而已。

怎么判断 sitemap 有没有起作用

  1. 在服務器日誌里搜 sitemap.xml,看蜘蛛是否定期来取;
  2. 看它取完之後,是否跟着抓取了文件里的部分 URL;
  3. 在覆盖率類报告里對比“已發現”和“已抓取”两個量——發現多、抓取少,說明瓶颈在抓取端,而不是發現端;
  4. 如果文件長期無人訪問,先回头查 robots.txt 声明和訪問權限。
sitemap 是“告诉”,收錄是“認可”,中間隔着抓取和质量判断。把 URL 送出去只是第一步,頁面本身值不值得被留下,才是後面的事。