日志里蜘蛛来访很多,索引量却没变化,是运营中很常见的困惑。原因通常不是蜘蛛偷懒,而是把“抓取”和“收录”当成了同一件事来看。
两件事的边界
抓取是蜘蛛把你的 URL 取回服务器,拿到 HTML 以及后续的渲染结果;收录是搜索引擎把这套内容处理、评估之后放进索引,可以在结果里被检索到。中间至少隔着:URL 发现、抓取调度、内容解析与渲染、质量与去重判断、索引写入。任何一步卡住,表面现象都是“抓过但没收录”。
为什么抓取量会虚高
- 蜘蛛爬的是你并不想收录的 URL:参数页、筛选页、重复列表,取回后判定价值不足,直接丢弃。
- 同一份内容存在多个 URL 变体,蜘蛛反复到访,实际只对应一份内容。
- 响应层不稳,蜘蛛来了却拿到超时或错误页,抓取次数计入,正文没拿到。
- 靠蜘蛛池或其他入口引来的抓取,很多落在低价值页面上,并不改变索引结构。
所以抓取次数上升,只能说明蜘蛛愿意来,不能说明它愿意收。
按顺序排查会更清楚
- 先看抓取的是哪些 URL。按目录、页面类型分组统计,判断新增抓取落在核心页还是碎片页。
- 再看返回状态和响应体。状态码 200 但内容是空壳、跳转页、验证页,等于没抓到有效内容。
- 然后看页面是否可索引。是否存在 noindex、canonical 指向别处、需要登录才可见等情况。
- 最后看内容本身是否值得收。与站内已有页面高度重合,或只是简单聚合列表,通常不会单独进索引。
URL 发现的质量决定上限
蜘蛛能找到什么,取决于你把什么放在它面前。内链、站点地图、主动提交是主要的发现渠道,这些渠道里如果混入大量排序与筛选参数,抓取配额就会被消耗在不会被收录的地址上。想提升有效抓取,先整理发现入口,比继续堆 URL 更实际。
把“蜘蛛来过”当成进度,很容易做出错误决策:继续加页面,而不是先修页面。
指标要分开读
建议同时记录三个数:按页面类型统计的抓取次数、有效抓取比例(拿到可索引内容的比例)、已收录 URL 数。有效抓取高而收录低,问题多在内容与规范化;有效抓取本身就低,问题多在发现和响应层。
一个简单的记录习惯
每周固定时间记录同类型页面的抓取量与收录变化,而不是只盯站点总量。类型之间的差异,往往比总量波动更能说明问题出在哪一环。