做站点运营的人常被一个问题绕住:站点到底收录了多少?但直接问“收录率是多少”往往得不到有用答案,因为分子和分母都可能算错。把三个数字分别理清——站点总 URL、可索引 URL、已收录 URL——对账才有意义,后面的判断也不会跑偏。
为什么先要把分母分开
如果把所有历史 URL 都塞进分母,收录率看起来永远很低;如果只统计最近一批 sitemap 里的地址,比例又会虚高。分母定义不同,结论完全不同,所以要做的第一件事不是去查收录状态,而是先把口径写下来:统计范围是什么、排除哪些、多久跑一次。
三个数字分别怎么取
站点总 URL:以站内链接图为主
优先从内链结构出发统计:从首页开始,顺着站内链接能到达的 URL 集合。这比只看 sitemap 更接近蜘蛛实际能发现的范围。sitemap 可以作为补充来源,但两份数据要合并去重,否则同一页面会被重复计算。
可索引 URL:总 URL 减去明确排除的部分
这一步的难点不在技术,而在取舍。常见需要排除的包括:
- 被 robots.txt 拦截的目录,比如后台、接口路径
- 带 noindex 的页面,例如搜索结果页、空结果页
- canonical 指向别处的重复页
- 由参数组合生成的排序、筛选变体
- 登录后、购物车、会话相关的动态页面
减完之后剩下的,才是“应该被收录”的量,也就是对账时真正该用的分母。这个数字一旦确定,就不要频繁改口径,否则前后两次统计没有可比性。
已收录 URL:多来源交叉验证
查询语法、索引状态报告、服务器日志里的蜘蛛抓取记录都可以用,但各自的误差也很明显:站点查询覆盖不全,日志只能说明被抓过、不代表进了索引,索引状态报告给出的往往是抽样结果。几个来源取并集,再从中抽一部分页面人工核对,结论会稳得多。要注意日志里的抓取记录和最终索引状态是两件事,别混着算。
对账之后,差异通常落在三档
把三个数字摆在一起,一般会出现三档落差,每一档对应的问题不同:
- 总 URL 明显大于可索引量:说明站内存在大量本就不该被收录的地址,先检查参数、筛选页和内链是否把无关链接铺得到处都是。
- 可索引量大于已收录量:说明有页面提交了却没进索引,优先看内容是否单薄、是否与其它页面高度重复、是否长期没有内链入口。
- 已收录里混着不想收录的页面:多半是屏蔽手段没对上,noindex、robots.txt、canonical 各自的作用范围需要重新确认。
一套可以定期跑的对账流程
- 固定统计周期,比如每月一次,避免用零散数据下结论。
- 导出站内链接图,合并 sitemap,去重得到总 URL 清单。
- 按既定规则剔除明确排除的地址,得到可索引清单。
- 用索引状态报告和站点查询取并集,得到已收录清单。
- 计算两个比例:可索引量 / 总量、已收录量 / 可索引量。
- 从“已可索引但未收录”里抽 20 到 50 条页面,逐条看内容、内链、重复度。
- 把本次结论和新发现的排除项写回规则文件,下次统计沿用。
流程本身不复杂,麻烦的是坚持同一口径。很多人每次都用不同的方法取数,结果就是每个月都在重新解释一遍数字。
别把覆盖率当成 KPI
覆盖率是一个诊断指标,不是目标。把比例做高最省事的办法是拼命扩充分母,或者把大量低价值页面也送进索引,这对搜索表现没有帮助。真正值得盯的是:应该被收录的页面有没有都进来,不该进来的有没有被挡住,以及新页面从被发现到进入索引的节奏是否稳定。
收录对账的价值不在那个百分比,而在于它能告诉你下一件该做的事是什么:是清理参数链接,还是补内容,还是调整屏蔽策略。