網站收錄

sitemap 提交了却没收錄:網站地图能做和不能做的事

sitemap 常被当成收錄開關,提交上去就等着索引變多。它實际解决的是 URL 發現,並不负责收錄。這篇文章梳理 sitemap 能做和不能做的事、常见的四種誤用、值得寫進清單的 URL 類型,以及提交之後该怎么分层观察效果。

網站收錄

sitemap 提交了却没收錄:網站地图能做和不能做的事

很多人對 sitemap 有一個朴素的理解:把 URL 寫進去提交,搜尋引擎就會收錄。實际跑一段時間就會發現,清單里的地址提交了几百條,索引里只多了几十條,剩下的大多停在已發現狀態。這不是 sitemap 失效了,而是它本来就不负责收錄這件事。

sitemap 解决的核心問题:發現

sitemap 最直接的價值是帮助蜘蛛發現那些靠内鏈不容易走到的 URL。比如深层列表頁、老文章、内鏈稀疏的詳情頁。蜘蛛顺着連結爬是一種路径,讀取 sitemap 是另一種路径,两者互补。對于新站或者内鏈结构還没理顺的站点,一份干净的 sitemap 能让新頁面更快被看到。

至于里面的 lastmod、changefreq、priority 這几個字段,實际影响比想象中小。lastmod 如果一直乱填,或者整站同步更新成同一時間,反而會失去參考價值。changefreq 和 priority 早已被主流搜尋引擎明确表示不作為重要依據。把精力放在 URL 的准确性上,比調這几個字段更划算。

常见的几種誤用

  • 把不该收錄的 URL 也寫進去:被 noindex 的頁面、返回 404 的舊地址、跳轉到別處的 301 URL。sitemap 和頁面本身的索引指令打架时,最後以頁面指令為准,寫進去只是浪費一次抓取。
  • 和 canonical 冲突:清單里同时列了 A 和 B,而 B 的 canonical 指向 A。這種做法會让搜尋引擎反复確認谁才是代表頁,對两邊都没好處。sitemap 里應该只出現規范化之後的那一個 URL。
  • 把 sitemap 当量工具:為了让收錄數字好看,把标簽頁、篩選參數頁、分頁第二頁之後全部塞進去。這些頁面通常没有獨立價值,大量出現反而稀释了對重点頁面的信号。
  • 提交之後不维護:URL 改了、頁面删了,sitemap 還是老版本。長期不更新的文件會让蜘蛛降低對它的信任度。

什么样的 URL 值得放進 sitemap

  1. 返回 200 且可以被索引,没有 noindex,也没有被 robots.txt 挡住。
  2. canonical 指向自己,也就是说它本身就是規范版本。
  3. 有獨立内容或獨立功能,不是同一批内容的另一個排列组合。
  4. 在站内有實际入口,用戶能通過点击到達,sitemap 只是补充通道而非唯一路径。

简單说,把 sitemap 想成一份推荐清單:告诉搜尋引擎哪些頁面優先看。既然是推荐,就不要把仓库里的東西全倒出去。

提交之後,怎么判断它有没有起作用

观察可以分三层。第一层看文件本身:能不能正常訪問、返回 200、是合規的 XML、没有语法错誤,後台的讀取狀態是成功。第二层看請求记錄:服務器日誌里有没有蜘蛛在相對固定的時間請求這個文件,請求之後是否顺着里面的 URL 去抓。第三层看结果:把清單里的 URL 數量和索引报告的頁面資料交叉對比,看增長的是哪一類頁面。

如果文件讀取正常、蜘蛛也确實抓了,但索引數量没有變化,問题基本不在 sitemap,而在頁面本身——内容重复、质量不足、和站内其他頁面高度相似。這时候要回头處理頁面,而不是反复重新提交。

sitemap 和内鏈的關系

两者不是替代關系。内鏈是蜘蛛的主路,sitemap 是备用通道。一個 URL 如果既没有内鏈,又只能靠 sitemap 被發現,說明它在站内结构里本来就是孤立的,即使被抓到,也很难获得足够的權重信号。

sitemap 的定位是降低發現成本,不是提高收錄概率。收錄與否,最终取决于頁面值不值得進索引。

把 sitemap 维護干净、保持更新、只放規范 URL,剩下的交给頁面质量和内鏈结构。這是它最合适的使用方式,也是它唯一能稳定發挥作用的地方。