站长工具里显示蜘蛛每天抓取几百上千次,可索引量长期停在原地,这种“抓得多、收得少”的情况很常见。抓取是搜索引擎来访问,收录是它愿意把页面放进索引并在搜索里展现,两件事的判断标准完全不同。把抓取次数当成收录进度,很容易在错误的方向上折腾。
第一步:先把三个数字分开算
动手处理之前,先明确自己在看哪一个数,否则讨论会一直绕圈。
- 抓取量:来自服务器日志,统计搜索引擎 UA 请求的 URL 数、状态码分布和抓取频次。
- 收录量:来自站长工具的索引报告或 site 指令的粗略估算,反映大致规模而非精确值。
- 有效收录率:用已收录数除以被抓取且返回 200 的 URL 数,比单看绝对量更有参考意义。
这三个数的口径本来就不一致:日志里包含大量被放弃的 URL、参数页和 304 请求,索引报告本身也有延迟。差个几倍不算异常,持续几个月不动才值得排查。
第二步:按目录和模板分层,找出拖后腿的那一批
整体收录率偏低,通常是少数几类页面拉低的。把日志按目录前缀、URL 形态、模板类型分组,分别算抓取量和收录量,问题集中在哪很快就清楚了。
常见的高抓取、低收录类型
- 筛选、排序、分页等参数组合生成的页面,数量巨大但彼此高度相似。
- 正文很短、主要由列表和推荐位拼成的聚合页或标签页。
- 同一内容的不同版本,多个 URL 指向近似相同的正文,缺少规范写法。
- 详情信息缺失的状态页,比如无库存、无评论、内容为空。
对照检查收录受阻的信号
选几个代表性 URL,用 URL 检查工具看它给出的状态:是“已抓取但未编入索引”,还是“已发现但未抓取”,或者被 canonical 指向了别的地址。不同状态对应完全不同的处理动作,混在一起改只会互相干扰。
第三步:按顺序处理,不要一次全动
- 先收敛发现路径。把不该被大量生成的 URL 从内链、sitemap 和列表入口里撤掉,减少蜘蛛把额度花在低价值页面上。
- 再处理重复与规范。近似重复的一组页面里选主版本,其余用 canonical 或 301 统一指向,避免信号分散。
- 最后补内容质量。对确实有价值的页面补充正文、结构化信息和内部链接,让它具备进入索引候选的资格。
顺序反过来的话,先给一堆低价值页面补内容,往往只是把抓取额度消耗得更多,收录率不会有明显改善。
索引是搜索引擎对页面价值的判断结果,任何操作都只能改善条件,不能保证某个页面一定被收录,也不能保证收录时间。
第四步:设定观察口径和周期
改动之后要能验证,最好提前定好口径:同一批 URL、同一段时间、同一统计来源。观察周期给到两到四周比较合理,期间不要反复改规则,否则数据没有可比性。同时看抓取状态码分布,200 的比例上升、5xx 减少,说明服务器侧没有拖后腿。
几个容易踩的坑
- 把 sitemap 里提交的 URL 数当成收录量,误以为趋势在变好。
- 只看总收录数,不看被抓取返回 200 的分母,收录率其实在下降也看不出来。
- 对整站统一加 noindex 或统一放开,忽略不同目录的价值差异。
- 频繁改动 canonical 和内部链接结构,让搜索引擎反复重新评估同一批页面。
抓取与收录之间隔着一层价值判断。能做的就是把发现路径理清、把重复收敛掉、把有价值的页面做扎实,然后给它时间。