網站收錄

站点地图提交了却不收錄:先把 sitemap 的角色摆正

很多人把 sitemap 当成收錄開關,提交後却發現收錄量和提交量對不上。本文說明 sitemap 真正解决的是 URL 發現而不是收錄,列出不该放進清單的頁面類型,並给出提交後抽样自查的可行做法。

網站收錄

站点地图提交了却不收錄:先把 sitemap 的角色摆正

不少人把 sitemap 当成收錄開關:文件生成好、提交到搜尋平台,接下来就等着頁面進索引。實际跑一段時間會發現,提交量和收錄量對不上,有时差得還很遠。問题通常不在文件本身,而在于對 sitemap 的定位理解偏了。

sitemap 解决的是“被發現”,不是“被收錄”

搜尋蜘蛛發現新 URL 主要有几條路径:站内連結、外部連結、sitemap,以及歷史抓取记錄。sitemap 在其中的作用是补充性的——它帮蜘蛛知道“這個站還有這些地址”,但知道之後要不要抓、抓完要不要编入索引,是另外两個獨立环节。

  • 被 sitemap 列出:URL 進入待抓取队列
  • 被抓取:拿到 HTTP 狀態和 HTML 内容
  • 被索引:内容质量、重复程度、站点整体情况综合判断

這三步任何一步卡住,最终结果都是“提交了却搜不到”。所以看到 sitemap 里的 URL 没有收錄,先別急着改文件,應该回到索引狀態报告里看它停在哪一档。

哪些 URL 不该放進 sitemap

sitemap 是一份“希望被收錄”的清單,往里塞不该收錄的地址,只會稀释它的信号價值,也會白白消耗蜘蛛的抓取額度。

  • 被 noindex 的頁面:一邊告诉蜘蛛別索引,一邊又列進 sitemap,属于自相矛盾。
  • 重定向 URL:301、302 的舊地址應该寫成跳轉之後的目标地址。
  • 返回 404 或 410 的地址:已经下架的頁面尽快從文件里移除。
  • 大量參數组合頁:篩選、排序、會话參數生成的近乎無限的 URL,應收敛而不是提交。
  • 非規范版本:如果 A 頁的 canonical 指向 B,那么 sitemap 里應该出現的是 B。
判断标准很简單:這個 URL 你是否真的希望它單獨出現在搜尋结果里?答案是否定,就別放進去。

lastmod 別乱寫

lastmod 是 sitemap 里少數會被參考的字段之一,前提是它准确。如果每次生成文件都把全部 URL 的時間刷成当天,時間一長這個字段就失去參考意义,蜘蛛也會逐渐忽略它。只在頁面内容确實發生實质變化时,更新對應條目的時間,才更有價值。

規模大时先拆分再提交

單個 sitemap 文件有數量和体积上限,通常不超過 5 萬條 URL、未压缩不超過 50MB。超過就拆成多個子文件,再用 sitemap 索引文件统一指向。拆分时按栏目或内容類型划分,比按生成時間随机切分更好排查問题,也方便後續單獨观察某一類的收錄情况。

提交之後的自查動作

  1. 從 sitemap 里抽样一批 URL,比如每個栏目抽二十條,把這批地址固定下来。
  2. 隔一段時間复查這批 URL 的抓取狀態和索引狀態,记錄變化。
  3. 對比没有放進 sitemap、但有正常内鏈入口的頁面,看两者的收錄节奏差多少。
  4. 如果差距很小,說明 sitemap 的邊际作用有限,重点该轉向内鏈结构和内容质量。

内鏈才是主通道

對多數中小站点来说,蜘蛛進入站内最稳定的路径,是從首頁和栏目頁一路跟下来的連結。sitemap 更适合處理那些連結入口較弱的頁面:刚發布還没被内鏈带到的内容、深层归档頁、變動频繁的頁面。如果站点本身的連結结构就很浅,頁面都能在两三次点击内到達,sitemap 更多是兜底,而不是主力。

把 sitemap 当成一份需要持續维護的清單,而不是一次性提交的動作。定期清理失效地址、补上新頁面、保持字段准确,再配合内鏈和内容质量一起看,收錄狀態才會慢慢稳下来。