網站收錄

三個收錄數字對不上:site 查询、索引覆盖和 sitemap 各算的是什么

site 查询、索引覆盖报告、站点地图三處的收錄數字经常對不上,這不一定是掉收錄。本文說明三者各自的口径與邊界,给出差距是否正常的判断标准,以及一份可执行的核對顺序,帮你分清頁面是没被發現、没被抓取,還是抓了没被收錄。

網站收錄

三個收錄數字對不上:site 查询、索引覆盖和 sitemap 各算的是什么

做站点运营,很多人會同时打開三個地方看“收錄”:搜尋框里敲 site 指令、搜尋资源平台的索引覆盖报告、以及站点地图的提交反馈。三個數字经常對不上,于是開始怀疑是不是掉收錄了。多數情况下,這不是資料出了問题,而是三者統計的根本不是同一件事。

三個數字各自在數什么

site 查询:估算值,不是清單

site 指令返回的是大致估算,而且會随查询词、地区、時間變化。它會把部分结果折叠、省略,也可能把一些它認為不合适的頁面排除在展示之外。所以它适合看“量級”,不适合当成精确台帳。今天 1200、明天 1100,通常說明不了什么。

索引覆盖报告:按 URL 計,但有它的邊界

索引覆盖报告統計的是搜尋资源平台已经知道的那些 URL,以及它們目前的狀態。它一般不會把平台完全不知道的地址算進去。站点如果没有提交 sitemap、内鏈也稀薄,报告里的數字天然小于實际存在的頁面數。

站点地图的“已编入索引”:只認清單里的 URL

站点地图反馈只针對你列進去的地址,而且資料通常有延迟,也可能是抽样。清單里少了頁面,這個數字就永遠追不上索引覆盖报告。

差多少算正常

三個數字之間存在差距是常態,尤其是頁面數量多、结构复杂的站点。可以按下面的经驗判断:

  • site 查询略高或略低于索引覆盖,正常;
  • 站点地图“已编入索引”略低于索引覆盖,正常,因為索引里往往還有歷史遗留、站外引用带進来的 URL;
  • 三者差距稳定、不持續扩大,通常不用處理。

什么情况下差异值得查

  • sitemap 索引率長期很低,比如提交几千條只有個位數被编入索引,這时候要回头看頁面质量、重复程度和入口内鏈。
  • 索引覆盖里的“已發現,尚未抓取”持續堆积,說明抓取跟不上,或者這些 URL 本身優先級被排到了後面。
  • 索引量连續下降且不是因為删站,需要逐類看是哪些頁面掉了,而不是只看總數。
  • 三個數字同时大幅波動,先確認最近有没有改版、換模板、動 robots 或調整 URL 结构。

比較實用的核對顺序

  1. 先固定一個時間点,導出索引覆盖报告,按狀態分類計數。
  2. 把 sitemap 里的 URL 與报告里的狀態做對照,找出“未發現”和“已發現未抓取”的部分。
  3. 抽样這些 URL,頁面本身能不能打開、正文是否在初始 HTML 里、是否有 canonical 指向別處。
  4. 检查這些 URL 有没有至少一個站内入口,還是只能靠 sitemap 找到。
  5. 對比同類頁面的收錄情况,判断是普遍問题還是個別頁面問题。

這样一轮下来,通常能定位到是没有被發現、發現了没被抓,還是抓了没被收錄。三者的處理方式完全不同:前者补入口和内鏈,中間這種看抓取压力和服務器响應,後者回到内容與重复度上找原因。

別把三個數字当成同一個指标

收錄數字是观察工具,不是考核目标。把 sitemap 索引率刷到 100% 並不等于頁面有價值,把 site 數字做大也不等于流量會涨。

更稳妥的做法是:用索引覆盖报告判断结构性問题,用 sitemap 反馈判断入口和清單是否完整,用 site 查询做一個粗略的横向感受。三個數字一起看趋势,比纠结某一天的差額更有意义。

如果三個數字長期對不上,先把口径對齐,再决定要不要動手。多數时候,需要的不是“提收錄”的技巧,而是把已经收錄的頁面確認一遍:该收的有没有入口,不该收的有没有挡住。