收录核对最常见的误区,是打开报表看总量,再随手查首页和几篇主力文章,发现“收录正常”就结束了。这种做法在很小的站点上偶尔够用,一旦 URL 数量到了几百上千,结论往往站不住:首页和主力页恰恰是最不愁收录的那批,它们进了索引,并不能说明产品页、筛选页、历史归档页也进了索引。
总量以下,先按模板把 URL 分组
同一套模板生成的页面,在抓取和索引上的表现通常高度相似:要么整组都能进,要么整组卡在同一个环节。所以抽样之前,先把站点 URL 按模板归类,一般可以分成这几组:
- 首页与栏目首页
- 内容详情页(文章、商品、问答等)
- 聚合列表页(分类、标签、归档、站内搜索结果页)
- 功能性页面(帮助、条款、登录后可见页)
- 由参数或多条路径生成的变体 URL
分组的作用,是把“全站收录率”这种模糊指标,拆成几组可以互相对比的数字。某一组明显偏低时,问题多半出在这组共用的模板或内链结构上,而不是随机波动。
每组抽哪些页面
样本要兼顾随机和边界。全部随机抽,容易漏掉真正被卡住的页面;只挑边界样本,又容易把个别现象当成普遍规律。一个简单做法是每组各取 10 到 20 个 URL,其中包含:
- 最近一周内新发布或刚改版的页面;
- 发布较久、已有外链或稳定访问的页面;
- 从站内入口点击路径较深的页面;
- 内链数量差异明显的两个极端样本;
- URL 结构上有特殊字符、多级路径或参数的页面。
样本量不必很大,但要尽量固定下来,下一次核对时沿用同一批。固定样本的价值在于可以纵向比较,看出状态是变好还是变差;每次换一批新样本,只能得到两个互不相干的快照。
每个样本记什么
只记“收录/未收录”信息太少,建议同时记录下面几项,方便后面判断卡在哪一步:
- 索引状态(已收录、已发现未抓取、已抓取未编入索引、已排除等);
- 最近一次抓取时间,以及这段时间内页面内容是否更新过;
- 索引到的版本是否与线上一致(标题、canonical、正文要点);
- 被发现的主要入口:内链、站点地图,还是外部链接。
状态字段只是辅助判断工具。不同搜索引擎的叫法和颗粒度不一样,也可能存在延迟或阶段性波动。它用来缩小排查范围,不适合给页面下最终结论。
抽样结果怎么读
先看组内一致性,再看组间差异。如果某个模板下十个样本有八个是同一状态,基本可以判断是模板层面的问题;如果状态参差不齐,更可能与单页内容、内链位置或发布时间有关。
组间比较则用来排优先级。详情页收录正常、聚合页大量未收录,处理顺序就应该从聚合页入手,而不是去改详情页模板。反过来,如果各组表现都不理想,那要回到更上游的环节:抓取是否顺畅、站点地图是否有效、服务器是否频繁返回错误状态。
几个容易踩的坑
- 只看总量比例:总量里混着不同模板,整体数字好看不代表每组都健康。
- 样本太少:三五个 URL 得出的结论,很容易被个案带偏。
- 用首页代表全站:首页通常内链和外链最多,它被收录几乎说明不了什么。
- 一次核对就下结论:索引状态本身会随时间变化,单次快照只说明当下。
把它变成固定节奏
抽样核对适合按周或双周做一次,记录格式保持稳定,改动前后各留一份对照。时间拉长之后,你看到的就不再是“今天收录了多少”这种单点数字,而是各组模板随时间的变化趋势。对站点运营来说,这条趋势比任何一次性的收录量都更有参考价值。