做收录自查时,很多人会卡在同一个问题上:三个地方看到三个不同的数字。Search Console 说已编入索引一万条,site: 查询显示三千条,服务器日志里被访问的 URL 又是另一个量级。它们并不是互相矛盾,而是在数不同的东西。先把每个口径在数什么分清楚,后面的判断才不会走偏。
三种口径分别在数什么
Search Console 的页面报告数的是“已编入索引的规范化 URL”,并且只覆盖你验证过的那部分资源。被排除的页面、被 canonical 合并掉的版本、robots 屏蔽的目录,都不会计入这个数字。它还有明显的更新延迟,几天到几周都算正常。
site: 查询返回的是搜索结果的条数,是一个粗略估算值。它会随查询词写法、查询地区、时间点而波动,同一个域名前后两次查询给出不同结果很常见。它适合用来看“量级”和“是否有异常”,不适合当作精确值来记录。
服务器日志记录的是抓取请求。被反复抓取不等于被收录,被抓取一百次的页面可能一次都没进索引,而一个几乎不来的页面也可能早就躺在索引里。日志反映的是抓取行为,不是索引状态。
第三方工具的数字来自它自己抓取或合作的索引样本,更新节奏和你实际提交的内容并不是同一套时间线。
一句话概括:日志回答“来过没有”,site: 回答“大概有多少”,页面报告回答“哪些被算进来了”。三个问题的答案本来就不会相等。
数字对不上的常见原因
- 统计对象不同:抓取次数、索引条数、可展现条数、有效页面数,是四个层面的东西。
- 规范化合并:多个 URL 被归并到一个主版本后,页面报告只按主版本计数,而日志里每个变体都算一次。
- 更新延迟:索引刷新、报告生成、日志汇总三者时间窗不一致,跨口径对比必然错位。
- 范围不同:子域名、目录、多语言版本可能不在同一个资源分组里,site: 查询又往往把整个域名都算进来。
正确的对比方式
- 同一口径只比趋势:页面报告和历史页面报告比,日志和历史日志比,不要拿页面报告去减 site: 的数字。
- 固定查询条件:site: 查询固定写法、固定地区、固定时间点,只观察变化方向,不记录绝对数值。
- 以分组为单位:按目录或内容类型分组看收录比例,比看全站总数更有意义,也更容易定位问题出在哪一块。
- 把口径写下来:团队里约定每次自查用哪套指标,避免不同的人拿着不同的数得出相反的结论。
真正排查时的顺序
- 先明确要回答的问题:是“收录总量掉了”,还是“某类页面不进索引”,还是“抓取量异常”。问题不同,该看的报告不同。
- 用页面报告看“已排除”的原因分布:这类页面的占比变化,通常比总数变化更能说明问题。
- 用 URL 检查看单个页面的实际状态:挑几个代表性 URL,确认它当前是已编入索引、已抓取未编入索引,还是被排除。
- 用日志确认抓取是否到达:如果日志里连抓取都没有,那问题在 URL 发现或抓取环节,和索引无关。
- site: 只做粗看:用来确认域名整体还在,不作为结论依据。
容易被误判的几种情况
- 收录数下降,但掉的是低价值页面:部分聚合页、参数页被剔除后总数下降,实际有效收录并没有变差。
- 日志量上涨,收录没有上涨:抓取增加可能来自重定向链、参数组合或重复路径,不产生新的索引条目。
- site: 数字来回跳:多数情况下只是估算值波动,连续观察一两周再判断更有依据。
收录数字的价值不在精确,而在于变化方向和原因定位。把三种口径各自代表什么写在自查清单里,每次用同一套方式记录,才能看出真正的趋势,而不是被三个不同的数字来回牵着走。