網站收錄

Sitemap 提交了收錄却没變化:從 URL 發現到抓取的排查顺序

Sitemap 提交後收錄没有變化,問题往往不在提交動作本身。本文按“是否被讀取、URL 是否合格、是否被發現、抓取是否跟上、抓取後是否進索引”的顺序,梳理一份可执行的检查清單,帮助你把精力放在真正卡住的那一步。

網站收錄

Sitemap 提交了收錄却没變化:從 URL 發現到抓取的排查顺序

Sitemap 常被当成收錄的快捷通道,實际上它更像一份给搜尋引擎的线索清單:告诉對方這些 URL 存在、大致什么时候更新過。至于會不會抓、抓了會不會進索引,仍然取决于站点的抓取條件和頁面本身的质量。所以当 sitemap 提交後收錄没有變化,比較有效的做法不是反复重新提交,而是顺着“讀取—URL 合格性—發現—抓取—索引”逐段看。

一、先確認 sitemap 本身有没有被正常讀取

  • 地址能不能正常訪問:直接打開 sitemap 地址,確認返回 200,而不是 404、301 或需要登入才能看到的頁面。
  • robots.txt 里的声明:在 robots.txt 中用 Sitemap 一行给出完整地址,方便被發現;同时確認 sitemap 文件本身没有被自己的規則挡住。
  • 格式與编碼:XML 语法完整、标簽閉合正确、编碼统一為 UTF-8,避免解析中断。
  • 後台的讀取狀態:看最後讀取時間和已讀取的 URL 數量,比只看“已提交”三個字有用得多。

二、sitemap 里的 URL 是否值得被收錄

sitemap 不是 URL 收容所。放進去的地址如果本身有問题,反而會稀释這份清單的參考價值。

  • 只放返回 200 的規范地址,重定向鏈上的 URL、404 頁面不要放。
  • 已经設定 noindex,或 canonical 指向其他頁面的 URL 不要放進来,两邊信号會互相矛盾。
  • 參數頁、篩選頁、分頁這類頁面要么按收敛策略處理,要么有選擇地放,而不是整站全量導出。
  • lastmod 尽量真實。全站每次生成都刷成当天,這個字段就失去了參考意义。
  • 單個文件不要超過 5 萬條、50MB 的上限,超出就拆分並用索引文件组织。

三、URL 有没有真正被發現

sitemap 只是發現路径之一,内鏈才是主路径。一個頁面只出現在 sitemap 里、站内没有任何連結指向它,被發現和被重视的程度通常都有限。

  • 检查頁面能否從首頁顺着連結点進去,层級不要太深。
  • 列表頁、相關推荐、面包屑這些位置有没有指向目标頁面的連結。
  • 連結是普通 a 标簽,還是需要执行脚本才會出現的元素;後者會降低發現效率。

四、發現了但抓取没跟上

如果日誌里能看到蜘蛛来過,但抓取频率很低,問题通常不在 sitemap,而在抓取條件:服務器响應時間過長、大量 URL 返回 5xx、頁面体积過大、robots 規則挡住大半個站点,都會让抓取预算花不到重要頁面上。先解决這些基础問题,再谈提交频率才有意义。

五、抓了却没進索引

這一步和 sitemap 基本無關,属于頁面质量與重复度問题:内容單薄、模板化嚴重、與站内其他頁面高度相似、缺少明确的主题價值。這时候繼續優化 sitemap 收益很小,應该回到頁面本身做調整。

一份可以按顺序执行的检查清單

  1. 打開 sitemap 地址,確認返回 200 且格式正确。
  2. 在 robots.txt 中声明 sitemap,確認没有被自身規則屏蔽。
  3. 核對 sitemap 中是否存在 404、重定向、noindex、canonical 冲突的 URL。
  4. 抽样几條 URL,確認站内有正常内鏈指向。
  5. 查看服務器日誌,確認蜘蛛是否訪問、訪問频率如何。
  6. 對已抓取未收錄的頁面,回到内容质量與重复度做判断。
把 sitemap 理解成线索清單而不是收錄開關,排查时就不容易在“重新提交”這個動作上反复打轉。

日常维護上,保持 sitemap 與站点現状一致、URL 干净、更新节奏稳定,通常比频繁重提交更實际。提交只是起点,真正决定收錄的,還是這些 URL 能不能被顺利發現、抓取並被判断為有價值的頁面。