網站收錄

站点地图提交了却迟迟不见收錄:sitemap 的真實作用與常见寫法問题

sitemap 常被当作收錄開關,但它解决的主要是 URL 發現問题。本文說明 sitemap 能做什么、哪些 URL 该寫進去、lastmod 與分片索引文件的常见誤区,以及在提交之後该按什么顺序自查。

網站收錄

站点地图提交了却迟迟不见收錄:sitemap 的真實作用與常见寫法問题

不少人把站点地图(sitemap)当成收錄開關:文件提交上去,就等着頁面進索引。實际用一段時間會發現,sitemap 狀態顯示“成功”和頁面真正被收錄之間,還隔着好几道關卡。搞清楚它到底在流程的哪個位置起作用,能省掉很多無效折腾。

sitemap 解决的是發現問题,不是收錄問题

蜘蛛發現一條 URL,通常有几個来源:站内連結、外鏈、sitemap,以及歷史抓取记錄。sitemap 的價值在于,它能让那些内鏈較弱或层級較深的頁面也進入待抓取队列,尤其是新站、内鏈结构還没搭好的站点。

但被發現只是第一步。後面還有抓取、内容解析、质量判断、索引归属這几關,每一關都可能让頁面停在原地。所以看到“sitemap 已讀取,但頁面没收錄”,不必先怀疑文件本身,更多时候問题出在頁面内容和站点结构上。

哪些 URL 值得寫進 sitemap

一個基本判断标准是:這條 URL 你希望它出現在搜尋结果里,並且它确實能獨立满足用戶需求。按這個标准,可以這样取舍:

  • 放進:正文頁、产品頁、有獨立價值的分類頁、更新频率稳定的栏目頁。
  • 不放:返回 404 或 410 的地址、重定向跳轉用的 URL、带 noindex 的頁面。
  • 谨慎放:篩選參數頁、排序頁、分頁中的深层頁、内容高度雷同的聚合頁。這些通常是抓取预算的消耗大戶,放進去容易让真正重要的頁面排队更久。
  • 寫法上尽量只放規范地址。同一内容有多種寫法时,sitemap 里出現多個版本,會给索引归属增加不必要的判断成本。

几個高频的寫法問题

lastmod 随手填

lastmod 的作用是告诉蜘蛛“這頁确實變了”。如果每次生成 sitemap 都统一寫上当天日期,等于持續發出错誤信号。短期内蜘蛛可能增加訪問,但几次下来發現内容没變,這個字段的參考價值就會下降。建议只在内容有實质改動时更新,且與頁面上的可见更新時間保持一致。

把不可索引的 URL 也塞進去

被 robots.txt 屏蔽的地址、需要登入才能看的頁面、返回 5xx 的地址,寫進 sitemap 只會換来一批無效抓取。提交前掃一遍狀態碼和 robots 規則,比事後排查省事。

分片與索引文件没配對

單個 sitemap 文件有數量和体积上限,超過就要拆分成多個子文件,再用一個索引文件(sitemap index)把它們串起来,並且在 robots.txt 或站長平台里提交索引文件本身。常见错誤是子文件都提交了,索引文件却没更新,或者子文件換了命名但索引里還是舊路径。

提交之後的自查顺序

如果提交了一段時間仍没動静,可以按這個顺序看:

  1. 確認 sitemap 文件能被正常訪問,返回 200,内容是合法的 XML,没有多余的 HTML 轉义错誤。
  2. 確認文件里没有混入 noindex、重定向或错誤狀態的 URL。
  3. 抽查几條目标 URL,直接在浏览器里訪問,看内容是否完整、是否需要登入、是否有前端渲染才出現的内容。
  4. 看這些頁面在站内有没有内鏈指向。sitemap 能帮忙發現,但内鏈才是蜘蛛持續回訪的主要路径。
  5. 對比抓取日誌,確認蜘蛛是否来過這些地址。来了但没收錄,問题在内容侧;根本没来,問题在發現和抓取配額侧。
把 sitemap 理解成一份“候選清單”更准确:它告诉蜘蛛有哪些地址值得一看,但看不看、收不收,最终取决于頁面本身的质量和站点整体的可信度。

说到底,sitemap 是一個低成本的辅助工具,维護它的重点是准确和干净,而不是塞得越多越好。與其反复調整文件格式,不如把精力放在内容是否獨立成篇、内鏈是否通畅、同一内容是否只有一個主地址上——這些才是影响收錄结果的主要因素。