做收录核对时,最常见的困惑是:site: 查询显示的数量、索引报告里的数字、日志里的抓取记录,三者常常对不上。这三者本来就不是一回事,直接拿数字互相比较,很容易得出错误结论。更稳的做法是先把口径分清楚,再按固定顺序抽查。
一、三个口径各自代表什么
site: 查询
它只反映当前搜索条件下能检索到的结果数量,会受查询词、地区、时间、个性化以及估算方式影响。同一个站隔天查两次,结果差几倍都很正常。它适合看趋势,不适合当精确值。
索引报告
索引报告是站点级的分组统计,比如“已编入索引”“已发现,尚未编入索引”“已抓取,尚未编入索引”等。它的价值在于分类,而不是总数。看到总数波动时,要先去对应分组里找原因。
服务器日志
日志记录的是抓取事实,与是否收录没有直接关系。抓取被拒、抓取后未编入索引、抓取的是不需要收录的 URL,都会造成“日志很热闹、收录没变化”。
二、核对时建议的顺序
- 先固定样本集。从各主要目录各取若干条代表性 URL,做成一份 50–100 条的清单,覆盖首页、栏目页、详情页、分页、带参数页等。不要每次临时挑 URL,否则前后对比没有意义。
- 用网址检查确认页面级状态。对整个样本集逐条查看,记录“已编入索引 / 已发现未编入 / 已抓取未编入 / 被排除原因”。
- 把 site: 查询只当作趋势参考。记录数量变化即可,不必解释每一次涨跌。
- 日志按状态码和页面类型分组。200、301、404、5xx 分开看,再按目录归类,找出抓取集中在哪些类型上。
三、三种常见的“对不上”
1. 日志一直在抓,报告显示“已发现,尚未编入索引”
说明发现和抓取都不缺,卡在编入环节。此时要检查的是页面本身:内容是否过于单薄、是否与其他页面高度重复、是否有明确的主题指向。继续加大抓取频率通常不会改变结果。
2. 报告显示已编入索引,site: 却搜不到
索引状态和可检索状态是两件事。页面可能因为查询词不匹配、被更相关的页面取代,或展示层过滤而搜不到。判断收录请以网址检查为准,不要用 site: 反推。
3. site: 数量上涨,报告里没变
多半是 URL 变体被计入了统计,比如带参数、带尾斜杠、大小写不同的地址。这类情况先去核对 canonical 与内链指向,把变体收敛,而不是追查“为什么收录变多了”。
四、做一张可复用的记录表
字段建议包含:URL、页面类型、最近抓取时间、索引状态、排除原因、内链数量、canonical 指向。每次核对只更新这张表,横向对比才有依据,也方便交接给同事继续跟进。
同一个数字在不同工具里含义不同,先统一口径,再讨论结论。
五、什么时候该停下来
如果连续几轮核对下来,样本集里的页面状态没有实质变化,那就不是再查一次能解决的问题,而是内容质量、URL 规范或站点结构层面的问题。核对的目的不是把数字对齐,而是找到卡住的那一步。