收录这件事,很多人是盯着一个总量数字看的:涨了高兴,跌了紧张。但数字本身说明不了问题,它只是三个口径叠在一起的估算值。真正有用的是做一次对账——把站点上真实存在的页面、sitemap 里声明的 URL、以及索引里的记录放在同一张表里比对,看差异出在哪一类页面上。
为什么要对账,而不是看总量
总量是结果,对账是过程。总量只能告诉你“多了”或“少了”,对账能告诉你“哪些目录多了”“哪些模板少了”。而且抓取和收录本来就是两件事:蜘蛛来过、返回了 200,只代表这个 URL 被发现了,不代表它进了索引。把这两层混在一起看,判断很容易跑偏。
第一步:拿到一份靠谱的线上 URL 清单
这份清单要尽量接近“站点上真实存在、且希望被收录的页面”。可以合并几个来源:
- sitemap:站点自己声明的范围,但要注意里面是否混了已下线或参数化的地址。
- 服务器日志:筛出蜘蛛抓取且状态码为 200 的 URL,这是外部实际看到的口径。
- 爬虫工具:按内链走一遍,能顺带发现孤岛页面。
- CMS 或后台导出:内容型页面最准的一份底账。
汇总之后先做一轮去重归一:统一大小写、去掉末尾斜杠差异、剥掉纯追踪参数、把 http 和 https、带 www 和不带 www 归到同一个代表地址上。不做这一步,后面的比对会被大量伪差异淹没。
第二步:把索引口径拉出来对齐
索引这一侧没有唯一权威的数字来源。搜索命令、站长后台的覆盖报告、第三方工具的收录量,都会因为采样范围和更新节奏不同而对不上。建议的做法是:用后台报告看分类和原因,用搜索命令做抽样验证,第三方工具只当作趋势参考。
索引数量是估算,不是账本。对账的目的是找出有问题的 URL,不是让两边的数字相等。
第三步:把差异归类,别急着动手
差异基本落在四类里,处理方式完全不同:
- 清单里有、索引里没有:可能刚发布还没被抓取,也可能被 noindex 挡住,或者缺少内链入口,或者页面本身没有被收录的理由。
- 索引里有、清单里没有:常见于已下线但没做处理的页面、参数变体、大小写变体、测试环境残留、改版遗留的旧地址。
- 两边都有,但代表地址不一致:多为重复内容的归并问题,canonical 指向或站内链接指向不统一。
- 两边都有且一致:正常状态,不用管。
处理顺序:先收口,再补漏
顺序很重要。先把不该存在的 URL 收口——已下线的做 410 或 301,参数页用 robots 或规范标签约束,测试环境整段屏蔽。这一步做完,索引里的杂音会明显减少,剩下的差异才看得清。
再处理该收录却没收录的页面。按优先级检查三件事:页面有没有可被抓取的入口(内链、导航、sitemap);页面本身是否具备独立价值,还是模板批量生成的空壳;返回的状态和内容是否稳定。抓到问题就改问题,不要靠反复提交来催。
几个容易漏的地方
- 分页、筛选、排序、打印页这类由模板批量产生的 URL,往往数量大、价值低,需要按模板级别定规则,而不是一个个改。
- 标签页、作者页、归档页属于灰色地带,判断标准是它有没有独立的聚合内容。
- 同一内容的多语言或多地区版本,要确认相互之间的对应关系写对了,否则容易被当成重复。
- 改版或迁移之后一定要重做一次对账,旧地址的残留常常要过一段时间才显出来。
把它变成一件定期的事
不需要每周做,但改版后、大促前后、内容量级明显变化时值得做一次。把每次的差异整理成表,标注 URL、类型、原因、处理动作,积累几次之后,你会发现自己站点的收录问题其实集中在少数几个模板上。
对账的意义不是把数字做大,而是让每一个 URL 的存在状态都是你主动决定的:该被收录的,入口通畅、内容立得住;不该被收录的,有明确的规则挡住。做到这一点,收录量的波动也就不那么让人紧张了。