網站收錄

站点地图提交之後:放什么、不放什么,效果怎么驗證

站点地图只是把一份 URL 清單交给搜尋引擎,蜘蛛来不来、頁面收不收,取决于地址本身的狀態。本文讲清楚清單里该放哪些地址、哪些放進去只會添乱,文件结构要注意什么,以及提交之後用哪些方式判断它到底起了作用。

網站收錄

站点地图提交之後:放什么、不放什么,效果怎么驗證

站点地图(sitemap)常被当成一種“提交了就等着收錄”的工具,實际上它只是把一份 URL 清單交给搜尋引擎,等于告诉蜘蛛:這些地址存在,可以来看看。来不来、来几次、看完之後進不進索引,取决于頁面本身的狀態和站点整体质量。把 sitemap 当成线索而不是承诺,後面的判断會顺很多。

只放“希望被索引”的 URL

判断标准並不复杂:這個地址如果被用戶搜到,你愿不愿意它出現在结果里。愿意,再考虑放進去。

  • 返回 200 狀態碼,内容公開可訪問,没有登入墙或彈窗遮挡;
  • canonical 指向自身,或者它指向的規范版本也在這份清單里;
  • 頁面有獨立價值,不是纯篩選结果、排序參數或追踪連結的變体;
  • 移動端與桌面端只保留一套主 URL,另一套用對應關系标注,而不是两套並列提交。

這几類地址放進去只會添乱

清單越長越杂,蜘蛛對其中每個地址的信任度就越低。以下這些属于典型的不该提交項:

  • noindex 頁面:一邊告诉蜘蛛別索引,一邊把地址递過去,逻辑上自相矛盾;
  • 跳轉源地址:301 或 302 的舊 URL 應该提交跳轉後的目标,而不是跳轉前的入口;
  • 已失效頁面:404、410 的地址,以及早就下线的活動頁、临时专题頁;
  • 參數變体:带 utm、會话、排序、每頁條數參數的 URL,容易被当作重复内容;
  • 需要登入的内容:蜘蛛抓到的往往只是登入頁或空白頁,提交了也没有意义。
一句话原則:sitemap 是候選名單,不是收容所。该放的少而准,比一次寫满几萬條更有用。

文件本身的结构细节

單個 sitemap 文件建议不超過 5 萬條 URL、未压缩体积不超過 50MB,超了就拆成多個,再用 sitemap index 串起来。拆分维度按栏目或内容類型划分,比按時間随机切更利于日後排查,比如某個栏目掉出了索引,你能很快定位到對應的那份清單。

lastmod 要寫真實的最後修改時間。如果每次生成都刷新成目前時間,蜘蛛很快會發現這個字段不可信,慢慢就忽略它了。宁可只给确實改動過的頁面更新時間,也不要全量刷。

提交之後怎么驗證

  1. 在搜尋资源平台的 sitemap 报告里看是否解析成功、讀取了多少條;
  2. 用平台提供的收錄查询和索引覆盖报告,對比清單中的 URL 數量與實际被索引的數量,這里看的是趋势,不是單條结果;
  3. 翻蜘蛛訪問日誌,把日誌里的 URL 與清單做交集,看蜘蛛是否真的按清單在抓;
  4. 抽查若干地址,手動確認狀態碼、canonical、robots 元标簽是否和预期一致。

几個常见誤区

把 sitemap 当收錄開關

提交不等于收錄。如果頁面本身内容單薄、内鏈稀薄、站点整体可抓取资源有限,清單再完整也不會明顯改變结果。它能压缩的是發現成本,压缩不了的是頁面质量這道门槛。

只提交首頁和栏目頁

不少站点只把首頁、频道頁放進去,深层文章指望蜘蛛自己顺着連結爬。结果是点击深度大的頁面長期停留在“已發現未抓取”。把有代表性的内容頁也纳入清單,能减少對爬取路径的依赖。

寫完從不清理

頁面下线、改版、合並之後,舊地址還留在清單里,時間一長就混杂着大量 404 和跳轉。定期按狀態碼筛一遍,比一次性寫完放着不管更實用。

總结来说,sitemap 的價值在于降低 URL 發現的成本:它能把地址送到蜘蛛面前,但替頁面争取收錄這件事,它做不到。让清單保持“少而准”,再配合内鏈结构、狀態碼和内容质量一起看,它才算一個稳定的基础工具。