網站收錄

Sitemap 提交後没什么動静:按顺序做這几項自检

Sitemap 是一份建议清單,不是收錄開關。提交後長期没動静,多半不是搜尋引擎没看到,而是文件本身或里面的 URL 有問题。這篇文章按可訪問性、格式、loc 内容、lastmod、數量與分片、观察节奏几個层面给出一份可执行的自检顺序。

網站收錄

Sitemap 提交後没什么動静:按顺序做這几項自检

Sitemap 的作用常被高估。它本质上是一份“建议清單”,告诉搜尋引擎這里有一批 URL 可以来看看。它既不能强制抓取,也不能决定收錄,最终上不上索引,還是看頁面本身。不過在實际运营中,sitemap 确實能让新頁面、深頁和缺少内鏈的頁面更早被發現,所以值得認真维護。真正的問题是:提交之後一直没動静,该從哪里查起。

先確認這份文件能被正常讀取

  • 地址返回 200,不要是跳轉後的舊地址,也不要返回 404 或 403。
  • Content-Type 是 application/xml 或 text/xml。如果返回 text/html,多半是服務器把错誤頁当成内容返回了。
  • 没有被 robots.txt 屏蔽。禁止抓取 sitemap 所在路径,是很常见的自伤操作。
  • 文件較大时用 gzip 传輸没問题,但要确保解压後内容完整、没有截断。

格式與内容:几個容易踩的点

结构

顶层用 urlset,分片索引用 sitemapindex,命名空間指向 sitemaps.org 的 0.9 版本,每條记錄是 url 套 loc。loc 必须是绝對地址,URL 里的 & 要轉义,否則解析會失敗。

loc 里放什么

只放返回 200、且允许被索引的地址。带 noindex 的頁面、登入後才能看到的頁面、纯參數篩選頁、已经下线的舊地址,都不该出現在里面。另外,loc 里的地址要和頁面上的 canonical 保持一致,否則等于自己制造了一组互相矛盾的信号。

lastmod 別乱寫

lastmod 只在内容真正變化时更新。如果每次生成都寫成目前時間,搜尋引擎會很快学會忽略這個字段,连带整份文件的可信度一起下降。日期用标准格式,带時間的话注意时区。

數量與分片

單個文件最多 5 萬條 URL、未压缩大小不超過 50MB。超出就用 sitemap index 拆成多個子文件。一個 index 可以引用多個子 sitemap,但不要為了凑數把無關頁面塞進去。

提交之後该看什么

  1. 過几天在 Search Console 的 sitemap 报告里看是否被成功讀取,狀態是不是“成功”。
  2. 隔几天再看“已發現 / 已抓取”的頁面數有没有變化,刚提交时不要反复改文件。
  3. 如果長期没有新增抓取,看抓取統計是不是被其他部分占满了,比如大量參數頁、重复頁在消耗配額。

几個常见誤区

  • 提交等于收錄。不是。sitemap 影响的是發現速度,不解决頁面质量和重复問题。
  • URL 越多越好。塞進大量低质或错誤地址,反而會降低這份文件被信任的程度。
  • 改版後直接替換。過渡期最好让舊地址仍可訪問,sitemap 再逐步切換到新地址。
  • 只提交不清理。定期把 404、已合並、已下线的頁面去掉,比一直往里加更重要。
Sitemap 能做的是让 URL 更快被發現。是否抓取、是否進索引,取决于頁面能不能被訪問、内容有没有獨立價值,以及站点整体的质量水平。把它当成辅助工具,而不是收錄的開關。