站点运营

站点运营:Sitemap 自查,別让站点地图指着一堆搬走的地址

Sitemap 是站点交给搜尋引擎的地址清單,准确比數量更重要。本文從狀態碼、noindex 冲突、lastmod 真實性、參數頁、數量與体积限制、自動更新和提交狀態几個角度,整理一份可以按月执行的自查清單,帮你把這份文件维持在可用狀態。

站点运营

站点运营:Sitemap 自查,別让站点地图指着一堆搬走的地址

Sitemap 的作用是把站内值得被抓取的地址,用一份清單交给搜尋引擎。它不是收錄的保證书,但清單本身是否准确、是否及时更新,會直接影响搜尋引擎發現新頁面的效率。很多站点的問题不在于没有 sitemap,而在于這份文件经年累月没人管,指着的全是已经改版、下线或合並過的地址。

一份能用的 sitemap 應该是什么样

  • 里面列出的每個地址,訪問时都能正常返回内容,而不是跳轉或报错;
  • 只放你希望被收錄的頁面,登入後頁面、後台入口、站内搜尋结果頁、篩選參數頁不该出現;
  • lastmod 反映内容真正改動的時間,而不是每次生成时统一刷成目前時間;
  • 能随内容發布自動更新,不需要人工手動導出;
  • 在 robots.txt 中寫明位置,並提交到對應的搜尋平台後台。

逐項自查

一、清單里的地址是否還活着

抽一批地址批量請求一遍,看返回的狀態碼。返回 404、410 的應從 sitemap 中移除;返回 301、302 的,最好直接換成跳轉後的最终地址。長期保留失效地址,等于反复告诉搜尋引擎這里没東西。

二、有没有混進不该出現的頁面

常见誤入的有:登入與註冊頁、购物车、後台入口、带 session 參數的地址、站内搜尋结果頁、被 meta noindex 标记的頁面。sitemap 與 noindex 同时存在是自相矛盾的信号,而且很容易被忽略。

三、lastmod 是否可信

有些程序每次生成 sitemap 都把時間刷成当天,蜘蛛来過几次發現内容没變,就會逐渐降低對這個字段的信任。宁可留空,也不要寫假時間。

四、參數頁與重复地址

带 utm、排序、篩選參數的地址,如果内容與主地址基本一致,就不要放進去。真正需要單獨列出的篩選组合通常數量有限,且應先確認它們有獨立價值。

五、數量與体积限制

單個 sitemap 文件一般不超過 5 萬條地址、未压缩不超過 50MB。超過就拆成多個文件,再用 sitemap index 串起来。分片之後记得提交索引文件,而不是提交某一個分片。

六、更新與提交

检查生成任務是否還在跑,是否因為某次改版被停掉。生成之後確認 robots.txt 里的 Sitemap 行指向正确地址,並在搜尋平台後台看提交狀態和已發現地址數量的變化趋势。

几個容易踩的坑

  • robots.txt 里屏蔽了某個目錄,sitemap 里却還在列這個目錄的地址;
  • 網站換域名後,舊域名的 sitemap 仍在更新;
  • XML 格式出错,比如特殊字符没有轉义、编碼不是 UTF-8,導致整份文件讀不了;
  • 多語言站点没有区分語言版本,或缺少對應的 hreflang 關系。

一個轻量的检查节奏

  1. 每月抽检一批地址的狀態碼,處理死鏈與重定向;
  2. 每次大改版或調整栏目後,重新核對 sitemap 的覆盖范围;
  3. 每季度检查生成任務、robots.txt 引用和平台提交狀態;
  4. 把检查结果记在运营筆记里,方便對比變化。
sitemap 不會替你争取收錄,它只是把门牌号寫清楚。门牌号寫得准,来的人才少走冤枉路。

這件事花不了多少時間,但拖久了,代價是搜尋引擎對新内容的發現速度變慢,而這個變化往往不會给你明顯的提示。