把 sitemap 提交上去,等几天,收錄數没變——這是很常见的情况。原因往往不是 sitemap 没生效,而是對它的作用范围有誤解。sitemap 主要解决“發現”,不负责“决定收錄”。
sitemap 负责發現,不负责收錄
蜘蛛需要先知道一個 URL 存在,才會去抓。sitemap 是一份主動提交的线索清單,能帮新頁面、深层頁面更快進入抓取队列。但抓取之後是否進索引,由頁面本身的信号决定:内容是否有獨立價值、是否與已有頁面重复、是否可正常訪問、是否被規則挡住。sitemap 在這里没有投票權。
所以判断 sitemap 是否“有用”,不该只看收錄數涨了多少,而该看:這些 URL 有没有被更快地抓取,抓取时返回的狀態是否正常。
一份能被正常讀取的 sitemap
- 只放你希望被索引、且返回 200 的規范 URL,不要塞參數頁、篩選頁、已 noindex 的頁面。
- 單個文件控制在 5 萬條、50MB 以内,超出就分片,並在索引文件里列全。
- lastmod 如實填寫,只在内容有實质更新时才改。批量刷成当天日期,反而會让這個字段失去參考價值。
- 地址寫在 robots.txt 里,或直接提交到搜尋後台,两條路都做更稳妥。
提交後没動静,按這個顺序查
- sitemap 报告里是否“已讀取成功”。讀取失敗通常是格式、编碼或訪問權限問题。
- 抽取几個 URL 做單頁检查:返回碼、robots 是否屏蔽、是否有 noindex、canonical 指向哪里。
- 看這些頁面有没有站内入口。只在 sitemap 里出現、站内没有任何連結指向的頁面,抓取優先級會低很多。
- 核對内容。同一批模板生成的頁面,正文高度相似时,通常只有一部分會被保留在索引里。
- 看抓取日誌和抓取統計。若蜘蛛来得很少,問题可能出在整站,而不是 sitemap。
常见誤区
把 sitemap 当成“提交即收錄”的開關,是最常见的一種。還有几種:
- 把所有 URL 都塞進去。包括篩選、排序、會话參數,等于给蜘蛛發了一批重复线索,反而稀释了重点。
- 频繁改動 lastmod。每天都變會削弱可信度,真更新时反而看不出差异。
- 多個信号互相矛盾。一邊提交收錄、一邊屏蔽抓取,冲突时以頁面級規則為准,sitemap 只是线索。
- 只靠 sitemap 做發現。内鏈才是站点最稳定的發現通道,sitemap 是补充。
和別的發現渠道配合
比較稳的做法是:導航和列表頁保證主要栏目都有站内入口;新内容發布後及时出現在相關列表或推荐位;sitemap 覆盖全量規范 URL,作為兜底;外部入口顺其自然。這样即使某條通道延迟,頁面也不至于被彻底漏掉。
一句话總结:sitemap 让蜘蛛更快知道 URL 存在,至于它值不值得進索引,要靠頁面自己回答。