網站收錄

sitemap 提交了却没收錄:它到底能帮到什么

sitemap 常被当成“提交即收錄”的開關,其實它只作用在 URL 發現這一环。本文說明 sitemap 能做什么、帮不上什么,並给出提交後頁面仍未被收錄时的检查顺序,包括 robots、noindex、規范 URL、抓取狀態和頁面质量。

網站收錄

sitemap 提交了却没收錄:它到底能帮到什么

sitemap 解决的是“被發現”,不是“被收錄”

不少人把 sitemap 当成一個開關:提交上去,頁面就该進索引。實际流程要拆成三步——URL 被發現、頁面被抓取、頁面被判定為值得收錄。sitemap 主要作用在第一步:它给抓取器一份站点 URL 清單,省去靠連結一层层爬過去的時間。至于後面两步,取决于頁面能不能正常訪問、内容有没有獨立價值、是否與站内其他頁面高度重复,以及站点整体能分到多少抓取配額。

所以“提交了 sitemap,收錄數量却没動”是很常见的現象。問题可能出在文件寫法上,也可能出在頁面本身。

先確認 sitemap 有没有被正确讀取

文件本身是否有效

  • 格式要規范:單個文件 URL 數量與体积都有上限,超出後需要拆成多個文件並用索引文件串联。
  • URL 中的特殊符号要按 XML 規則轉义,否則整段内容可能解析失敗。
  • 只放規范地址:带追踪參數的、大小寫混用的、會跳轉的 URL 都不该出現在這里。
  • lastmod 要寫真實時間。习惯性把時間刷成“今天”,久而久之會被忽略。

位置和声明是否到位

把 sitemap 放在站点根目錄,並在 robots.txt 里寫明它的位置,能让抓取器更快找到。接着到搜尋後台看提交狀態和“已發現的頁面數”。如果長期顯示無法讀取,多半是被 robots 挡住了、返回碼不對,或者文件路径寫错。

sitemap 里的 URL 為什么進不了索引

  • 抓取被屏蔽:robots.txt 挡住了目錄,頁面连被抓的机會都没有。
  • 頁面带 noindex:這和提交 sitemap 是两個相反方向的信号,最终以 noindex 為准。
  • URL 不是規范版本:canonical 指向了另一個地址,收錄只會记在目标頁上。
  • 返回碼不對:出現 404、410 或 301 的地址應及时從清單里移除,只保留正常返回的最终地址。
  • 抓取器看到的内容不同:需要登入、按地域拦截或首屏全靠脚本渲染,都可能让它只看到一個空壳。
  • 頁面本身價值不够:内容太薄、與其他頁面高度重复,即使被發現也很难留下。

sitemap 帮不上忙的几件事

它不能提升頁面质量,不能替代内部連結,也不能改變抓取频率。它是补充手段,不是主力通道:一個長期没有内鏈指向、离首頁很遠的頁面,即使躺在 sitemap 里,被抓取的優先級也有限。至于蜘蛛池這類工具,做的事同样停留在“增加被發現的机會”這一层,對收錄结论没有决定權。

提交之後仍没收錄,按這個顺序查

  1. 用 URL 检查類工具看這個地址是否被抓取過、返回什么狀態碼。
  2. 检查 robots.txt 與頁面 meta,確認允许抓取、允许索引。
  3. 確認 sitemap 里寫的是規范地址,並且和 canonical 保持一致。
  4. 判断這個頁面值不值得留:内容是否獨立、有没有内鏈指向、点击深度是否太深。
  5. 给它一点時間。新站或新目錄可用的抓取配額有限,收錄通常分批發生,不會一次到位。
sitemap 是递给抓取器的一張地图,不是一道命令。地图画得再清楚,走不走、记不记,仍然由頁面本身决定。

把 sitemap 看作“索引的入场券”容易失望,把它看作“减少發現成本的小工具”更接近事實。真正影响收錄的,仍是那些能訪問、有内容、有内鏈的頁面。