收录核对时最常见的场景:站内查询显示 3 万,索引覆盖报告写 1.2 万,日志里半个月出现的独立地址有 5 万。三个数字都不假,但分母不同、时间窗口不同、对“收录”的定义也不同。直接拿其中一个下结论,后面的动作基本都会跑偏:按 3 万判断是“内容太多要收敛”,按 1.2 万判断是“页面质量不行要改模板”,方向正好相反。
三套数据分别在说什么
站内查询与站长工具:抽样后的代表地址
站内查询给的是估算值,会按目录、模板合并同类项,同一个模板下的相似页面往往只留一个代表。它适合看结构和覆盖方向,不适合当精确计数。
索引覆盖报告:按原因分组的结果
报告的强项是分组——已编入索引、已发现但未编入、已抓取但未编入、重复网页等。每一组的判定依据不同,把不同组直接相加没有意义。
抓取日志:请求层面的原始记录
日志记录的是“来过”,不是“收过”。同一个地址可能被反复抓取多次,也可能被不同 UA 抓取,去重前统计出的独立地址数会明显偏大。
对齐口径要动的四件事
- 时间窗口:日志是过去若干天的抓取,索引报告是某个时点的快照,站内查询还有缓存延迟。三者至少要锁到同一周,否则新老地址会互相干扰。
- URL 归一:协议、www、末尾斜杠、大小写、跟踪参数,先按统一规则归一,否则同一个页面会被算成两三个地址。
- 状态定义:明确什么叫“已收录”——是能被查到、能返回正文,还是只需要在报告里出现在某个分组。定义不同,数字自然不同。
- 分母:确认算的是全部地址、sitemap 里的地址,还是内链可达的地址。分子分母不同源,算出来的收录率没有可比性。
把差异落到具体地址上
口径对齐之后,如果还有差异,才值得进入下一步。做法很简单:三份列表都归一成同一套 URL 格式,做一次交叉比对,把地址分成四类——
- 三份都有:稳定的已收录页,作为基线。
- 日志有、报告无:抓了没收,重点看页面质量和重复情况。
- 报告有、日志无:可能是老地址靠历史信号撑着,需要确认是否还在维护。
- 只有站内查询有:多半是合并展示的代表页,别当成独立收录。
分类之后,每一类对应不同的处理动作,比笼统地说“收录不达标”要具体得多。
先对齐口径,再谈优化。拿两个不同口径的数字互相比,得到的结论往往只是统计噪声。
几个容易忽略的点
- 用移动端 UA 和桌面 UA 抓取,看到的返回可能不同,日志统计要分开看。
- 报告里的分组会随时间变化,同一个页面这周在“已发现”、下周进“已编入”,比较时要用同一时点。
- 站点改版、迁移、批量调整模板之后,历史基线会失效,最好重新取一次基线再比。
口径这件事不产出内容,但它决定了后面所有判断的可信度。花半天把三套数据对齐,往往比急着改十版模板更省事。