打开搜索资源平台或站长工具,最先看到的是几组数字:蜘蛛抓了多少、索引里存了多少、有多少页面真的拿到了展现。这三个数字经常被混着看,一看到收录量涨了就放心,一看到抓取量掉下来就慌。其实它们描述的是三件不同的事,混在一起看,判断很容易跑偏。
三个数字分别是什么
抓取量
抓取量记录的是蜘蛛来过多少次、取走了多少响应。它只说明“服务器把内容交出去了”,不代表蜘蛛看懂,更不代表会放进索引。抓取量受站点规模、更新频率、服务器响应速度、robots 规则、内链密度影响。抓取量大不等于收录多,但抓取量突然归零值得紧张——那通常是服务器、robots.txt 或者防火墙拦截出了问题。
收录量(索引量)
收录量是搜索索引里保存的 URL 数量。它包含大量不参与排名的页面,比如参数页、重复页、已被合并的页面。所以它是一个库存数字,不是成绩单。收录量上涨可能来自一批低质量页面被放进来,这种上涨对站点没有好处,甚至会让整站质量被稀释。
有效收录
有效收录才是真正有意义的一层:这些页面在搜索结果里出现过、拿到过展现,甚至有点击。它比收录量小很多,也更接近站点的实际流量来源。一个站点收录 10 万、有效收录 300,和收录 5000、有效收录 2000,后者通常更健康。
收录是库存,有效收录是动销。只盯库存,很容易做出错误的运营动作。
抓取多、收录少,先查什么
- 页面质量是否过得去。内容太薄、模板占位文字太多、正文和标题不匹配,蜘蛛抓完也可能不放进索引。
- 是否重复或高度相似。同一段内容出现在多个 URL 上,索引往往只保留少数版本,其余被合并或丢弃。
- URL 是否规范。大小写、斜杠、协议、参数顺序不一致,会制造出大量实际相同但写法不同的地址。
- 响应状态是否干净。返回 200 的空壳页、先 302 再 200 的跳转链,都会消耗抓取预算。
- 是否有内链支撑。没有内链指向的 URL,被发现和被判断为重要页面的概率都偏低。
收录多、有效收录少,通常意味着什么
最典型的情况是索引膨胀:站点自动生成了大量列表页、标签页、筛选页、搜索结果页,它们被收进去了,但没有任何搜索需求与它们对应。这类页面几乎没有展现,却占着索引空间,还容易和主页面抢同一批词。
另一种情况是内容同质化。同一主题写了十几篇角度相似的页面,搜索结果里只需要其中一个,其余页面拿到零星展现,长期处于“被收录但不被使用”的状态。
一套可执行的检查顺序
- 先看抓取日志,确认蜘蛛来的频率、抓取目录和返回码分布,找出被抓最多但价值最低的部分。
- 把索引量按目录拆开,看是哪些板块在膨胀。
- 对照有效收录,找出“只被收录、从无展现”的页面集合。
- 对这批页面分类处理:能补充内容的补内容,重复的做合并或规范,纯粹的参数页用 robots 或 noindex 收敛。
- 把抓取预算和内部链接集中到真正想参与排名的页面上。
处理完不要指望第二天就看到数字变化,索引更新有自己的节奏,通常需要一段时间才能反映出来。
几个容易踩的坑
- 把收录量当 KPI。单纯的收录数量涨跌,说明不了站点好还是坏。
- 为收录而收录。批量生成页面、堆砌入口,短期数字好看,长期拖累整站质量。
- 忽略展现数据。展现和点击才是页面有没有价值的直接证据。
- 只盯总量不看结构。总量稳定,但资源都耗在不产出流量的目录上,等于白忙。
把这三组数字放在一起看,判断会清楚很多:抓取量反映蜘蛛愿不愿意来,收录量反映索引里存了多少库存,有效收录反映这些库存到底有没有被用起来。运营动作应该朝着第三个数走。