为什么建议抽样,而不是盯着总数
site: 返回的数字是一个估算值,会随查询词、地区、时间上下浮动;Search Console 的覆盖率报告同样有延迟,并且按分组给出,很难直接对上具体页面。盯着一个天天变的数字,通常判断不出站点是真的出了问题,还是只是统计口径在抖。
抽样体检的思路是:挑一小批有代表性的 URL,逐个确认它们在抓取、索引、规范三个层面上的状态,再看这批样本里问题出现的比例和集中方向。它给的不是一个分数,而是一组可以顺着往下查的线索。
样本怎么挑:按页面类型分层
随机抽 30 个 URL 意义不大,因为不同模板的页面收录表现天然不同。更实用的做法是先给站点分层,再从每层里挑代表:
- 首页与核心栏目页
- 各频道的内容详情页,每个频道取几条
- 列表页与分页
- 标签、筛选、聚合类页面
- 最近新发布的页面
- 最近改动过标题或正文的页面
每层挑 3 到 8 个,总数控制在 20 到 40 个之间。样本不必随机,但一定要能覆盖站点的主要页面类型。建议把这批 URL 记下来固定在表格里,后面重复使用。
每个样本查五件事
- 是否被抓取。在服务器日志或 CDN 日志里确认搜索爬虫最近是否访问过这个 URL,返回的状态码是什么。
- 是否在索引里。用 site: 精确查询该 URL,或在 Search Console 的网址检查工具里看状态。要留意的是,site: 查不到并不等于没收录,它只能作为提示。
- 索引里用的是哪个网址。看搜索结果展示的是不是你期望的版本,比如 www 与非 www、https、尾斜杠、带参数的变体。
- canonical 是否被采纳。如果页面自己声明了规范网址,检查索引里的规范网址是不是它,还是被替换成了别的。
- 标题与摘要。展示出来的标题摘要是否来自页面主要内容。被大量替换,往往说明内容主体没被准确识别。
怎么读结果
不要看绝对数字,看两件事:问题是否集中在某一层,以及和上一次抽样相比是变好还是变差。
- 如果新页面这一层普遍没被抓取,问题多半出在站内入口和链接上。
- 如果详情页被抓取了,但索引里的规范网址指向了筛选页或列表页,问题在 URL 与 canonical 层面。
- 如果所有层表现一致地差,才需要往站点级因素上想,例如服务器稳定性、robots 配置、整体内容质量。
抽样体检的价值不在于给出一个健康分,而在于把“收录不好”这个模糊的判断,拆成某一层、某一环节上具体可查的问题。
排查顺序:抓取、索引、展示
顺序很重要,不要跳步。上一层没通,下一层的结论就不可靠。
- 没被抓取:先确认内链是否可达、robots 是否误封、服务器是否稳定返回 200。
- 抓取了没进索引:看页面质量与重复程度,是否与其他页面高度相似,站内是否明确了主版本。
- 进了索引但展示不对:检查标题摘要、结构化数据、canonical 与同页多址的情况。
每次只解决当前这一层的问题。修完之后隔一段时间,用同一批 URL 再抽一次,通过前后对比来验证改动是否有效,而不是改完当天就下结论。
几个常见误判
- 把 site: 的结果数量当成精确的收录量。
- 用一次查询就下结论,忽略地区、语言、设备差异带来的变化。
- 把爬虫来得频繁当成收录良好,其实抓取和索引是两件事。
- 页面刚改完就检查,没有给重新抓取和更新留出时间。
把抽样做成固定动作,比如每月一次、每次使用同一批样本,长期看趋势,会比每天刷新某个数字有用得多。它不会让收录立刻变好,但能让你在问题还小的时候先发现它。