网站收录

三个收录数字对不上:site 查询、索引覆盖和 sitemap 各算的是什么

site 查询、索引覆盖报告、站点地图三处的收录数字经常对不上,这不一定是掉收录。本文说明三者各自的口径与边界,给出差距是否正常的判断标准,以及一份可执行的核对顺序,帮你分清页面是没被发现、没被抓取,还是抓了没被收录。

网站收录

三个收录数字对不上:site 查询、索引覆盖和 sitemap 各算的是什么

做站点运营,很多人会同时打开三个地方看“收录”:搜索框里敲 site 指令、搜索资源平台的索引覆盖报告、以及站点地图的提交反馈。三个数字经常对不上,于是开始怀疑是不是掉收录了。多数情况下,这不是数据出了问题,而是三者统计的根本不是同一件事。

三个数字各自在数什么

site 查询:估算值,不是清单

site 指令返回的是大致估算,而且会随查询词、地区、时间变化。它会把部分结果折叠、省略,也可能把一些它认为不合适的页面排除在展示之外。所以它适合看“量级”,不适合当成精确台账。今天 1200、明天 1100,通常说明不了什么。

索引覆盖报告:按 URL 计,但有它的边界

索引覆盖报告统计的是搜索资源平台已经知道的那些 URL,以及它们当前的状态。它一般不会把平台完全不知道的地址算进去。站点如果没有提交 sitemap、内链也稀薄,报告里的数字天然小于实际存在的页面数。

站点地图的“已编入索引”:只认清单里的 URL

站点地图反馈只针对你列进去的地址,而且数据通常有延迟,也可能是抽样。清单里少了页面,这个数字就永远追不上索引覆盖报告。

差多少算正常

三个数字之间存在差距是常态,尤其是页面数量多、结构复杂的站点。可以按下面的经验判断:

  • site 查询略高或略低于索引覆盖,正常;
  • 站点地图“已编入索引”略低于索引覆盖,正常,因为索引里往往还有历史遗留、站外引用带进来的 URL;
  • 三者差距稳定、不持续扩大,通常不用处理。

什么情况下差异值得查

  • sitemap 索引率长期很低,比如提交几千条只有个位数被编入索引,这时候要回头看页面质量、重复程度和入口内链。
  • 索引覆盖里的“已发现,尚未抓取”持续堆积,说明抓取跟不上,或者这些 URL 本身优先级被排到了后面。
  • 索引量连续下降且不是因为删站,需要逐类看是哪些页面掉了,而不是只看总数。
  • 三个数字同时大幅波动,先确认最近有没有改版、换模板、动 robots 或调整 URL 结构。

比较实用的核对顺序

  1. 先固定一个时间点,导出索引覆盖报告,按状态分类计数。
  2. 把 sitemap 里的 URL 与报告里的状态做对照,找出“未发现”和“已发现未抓取”的部分。
  3. 抽样这些 URL,页面本身能不能打开、正文是否在初始 HTML 里、是否有 canonical 指向别处。
  4. 检查这些 URL 有没有至少一个站内入口,还是只能靠 sitemap 找到。
  5. 对比同类页面的收录情况,判断是普遍问题还是个别页面问题。

这样一轮下来,通常能定位到是没有被发现、发现了没被抓,还是抓了没被收录。三者的处理方式完全不同:前者补入口和内链,中间这种看抓取压力和服务器响应,后者回到内容与重复度上找原因。

别把三个数字当成同一个指标

收录数字是观察工具,不是考核目标。把 sitemap 索引率刷到 100% 并不等于页面有价值,把 site 数字做大也不等于流量会涨。

更稳妥的做法是:用索引覆盖报告判断结构性问题,用 sitemap 反馈判断入口和清单是否完整,用 site 查询做一个粗略的横向感受。三个数字一起看趋势,比纠结某一天的差额更有意义。

如果三个数字长期对不上,先把口径对齐,再决定要不要动手。多数时候,需要的不是“提收录”的技巧,而是把已经收录的页面确认一遍:该收的有没有入口,不该收的有没有挡住。