核对收录时,最容易出的问题往往不是工具不会用,而是时间点选错了。刚发完文章、刚改完模板、刚提交完一批 URL,就立刻去查,查不到就断定这个页面不被收录。实际上你看到的只是某一刻的快照,抓取、处理和索引写入之间本来就存在时间差。
为什么当天的结果不能直接下结论
一条 URL 从被发现到进入索引,中间要经过好几个环节:被蜘蛛发现、排队抓取、抓取成功、内容处理、判断是否值得建索引、写入索引。每个环节都可能排队,在新站或者抓取配额有限的站点上,排队时间会更长。
而且你查到的结果本身也可能滞后或者不同步:
- 不同的查询入口,返回的索引版本可能不在同一个时间点上;
- 站内搜索式的模糊查询只给一个数量,不给具体 URL,无法确认你要核对的那个地址到底在不在;
- 页面被重新抓取之后,索引里的内容替换同样有延迟。
所以今天查了没有,只能算一条记录,不能算结论。
核对前先定好三件事
把这三件事写在前面,后面的判断才不会来回摇摆。
- 观察窗口。给新页面留出一个固定的观察期,比如从首次被抓取算起,按天记录,而不是按小时刷新。窗口没走完,一律只记录,不下判断。
- 判断口径。统一用精确 URL 去查,不要一半靠模糊查询的数量、一半靠日志来交叉印证。口径不一致时,两个结果对不上只会让你更困惑。
- 记录方式。每一条 URL 至少记四项:上线时间、日志里第一次出现抓取的时间、查询到首次进入索引的时间、当前状态。有了时间线,你才能看出是卡在抓取前还是卡在抓取后。
什么情况下才值得判定没有被收录
只有同时满足下面这些条件,说没被收录才比较站得住脚:
- 页面本身可以正常访问,返回的是正常内容,不是报错页、跳转页或空白页;
- 页面没有被 robots 规则、noindex 之类的指令挡住;
- 日志里确实看到过蜘蛛抓取这条地址,说明它已经过了发现这一关;
- 观察窗口已经走完,而不是刚上线一两天。
这四条里任何一条不成立,问题就不在收录本身,而在更前面的环节。比如抓取没发生,就要回头去看发现渠道、内链和 sitemap,而不是继续盯着索引结果。
几个常见的误判
- 只查一次就下结论。单次查询反映的是一个瞬间,不足以说明趋势。
- 把索引里的数量当成索引质量。数量变多不代表有效页面变多,数量不变也不代表没有新增。
- 改完页面立刻核对。内容更新后索引里的版本替换需要时间,此时查到的旧版本属于正常现象。
- 混用不同来源的结果。日志、查询接口和时间点各不相同,混着比容易得出错误结论。
一个可执行的观察流程
- 页面发布后,先确认它可访问、没有被指令挡住、能从站内至少一个入口到达。
- 从日志里找这条 URL 的首次抓取时间,作为观察窗口的起点。
- 按固定周期用同一种查询方式记录状态,不临时换口径。
- 窗口走完后,把还停留在未收录状态的页面单独列出来,再按抓取与否分两类:抓过但没收的,去看内容层面的原因;没抓过的,回去补发现渠道。
- 把每一轮的处理结果记下来,下一批页面用同一套标准对照。
收录核对真正要做的,不是每天问一次在不在,而是把发现、抓取、索引三个时间点连成一条线。看清卡在哪一环,比反复刷新查询结果有用得多。