网站收录

给站点做一次收录对账:把线上页面、sitemap 和索引记录对齐

收录数字对不上时,与其纠结哪个工具更准,不如做一次对账:把服务器上真实返回的页面、sitemap 里声明的 URL、索引里的记录放进同一张表比对。按“该有却没有”和“不该有却存在”分类,再决定是收口还是补漏。本文给出一套可执行的步骤、常见差异类型和处理顺序。

网站收录

给站点做一次收录对账:把线上页面、sitemap 和索引记录对齐

收录这件事,很多人是盯着一个总量数字看的:涨了高兴,跌了紧张。但数字本身说明不了问题,它只是三个口径叠在一起的估算值。真正有用的是做一次对账——把站点上真实存在的页面、sitemap 里声明的 URL、以及索引里的记录放在同一张表里比对,看差异出在哪一类页面上。

为什么要对账,而不是看总量

总量是结果,对账是过程。总量只能告诉你“多了”或“少了”,对账能告诉你“哪些目录多了”“哪些模板少了”。而且抓取和收录本来就是两件事:蜘蛛来过、返回了 200,只代表这个 URL 被发现了,不代表它进了索引。把这两层混在一起看,判断很容易跑偏。

第一步:拿到一份靠谱的线上 URL 清单

这份清单要尽量接近“站点上真实存在、且希望被收录的页面”。可以合并几个来源:

  • sitemap:站点自己声明的范围,但要注意里面是否混了已下线或参数化的地址。
  • 服务器日志:筛出蜘蛛抓取且状态码为 200 的 URL,这是外部实际看到的口径。
  • 爬虫工具:按内链走一遍,能顺带发现孤岛页面。
  • CMS 或后台导出:内容型页面最准的一份底账。

汇总之后先做一轮去重归一:统一大小写、去掉末尾斜杠差异、剥掉纯追踪参数、把 http 和 https、带 www 和不带 www 归到同一个代表地址上。不做这一步,后面的比对会被大量伪差异淹没。

第二步:把索引口径拉出来对齐

索引这一侧没有唯一权威的数字来源。搜索命令、站长后台的覆盖报告、第三方工具的收录量,都会因为采样范围和更新节奏不同而对不上。建议的做法是:用后台报告看分类和原因,用搜索命令做抽样验证,第三方工具只当作趋势参考。

索引数量是估算,不是账本。对账的目的是找出有问题的 URL,不是让两边的数字相等。

第三步:把差异归类,别急着动手

差异基本落在四类里,处理方式完全不同:

  1. 清单里有、索引里没有:可能刚发布还没被抓取,也可能被 noindex 挡住,或者缺少内链入口,或者页面本身没有被收录的理由。
  2. 索引里有、清单里没有:常见于已下线但没做处理的页面、参数变体、大小写变体、测试环境残留、改版遗留的旧地址。
  3. 两边都有,但代表地址不一致:多为重复内容的归并问题,canonical 指向或站内链接指向不统一。
  4. 两边都有且一致:正常状态,不用管。

处理顺序:先收口,再补漏

顺序很重要。先把不该存在的 URL 收口——已下线的做 410 或 301,参数页用 robots 或规范标签约束,测试环境整段屏蔽。这一步做完,索引里的杂音会明显减少,剩下的差异才看得清。

再处理该收录却没收录的页面。按优先级检查三件事:页面有没有可被抓取的入口(内链、导航、sitemap);页面本身是否具备独立价值,还是模板批量生成的空壳;返回的状态和内容是否稳定。抓到问题就改问题,不要靠反复提交来催。

几个容易漏的地方

  • 分页、筛选、排序、打印页这类由模板批量产生的 URL,往往数量大、价值低,需要按模板级别定规则,而不是一个个改。
  • 标签页、作者页、归档页属于灰色地带,判断标准是它有没有独立的聚合内容。
  • 同一内容的多语言或多地区版本,要确认相互之间的对应关系写对了,否则容易被当成重复。
  • 改版或迁移之后一定要重做一次对账,旧地址的残留常常要过一段时间才显出来。

把它变成一件定期的事

不需要每周做,但改版后、大促前后、内容量级明显变化时值得做一次。把每次的差异整理成表,标注 URL、类型、原因、处理动作,积累几次之后,你会发现自己站点的收录问题其实集中在少数几个模板上。

对账的意义不是把数字做大,而是让每一个 URL 的存在状态都是你主动决定的:该被收录的,入口通畅、内容立得住;不该被收录的,有明确的规则挡住。做到这一点,收录量的波动也就不那么让人紧张了。