新页面发布后迟迟没有收录反馈时,很多人第一反应是“蜘蛛没来”。但看日志往往会发现,蜘蛛其实一直在抓,只是把抓取机会花在了别的地方。与其反复提交 URL,不如先做一次抓取盘点:看清蜘蛛最近抓了什么、为什么抓、这些 URL 值不值得抓。
抓取预算不是一个固定数字
搜索引擎不会给每个站点发一个额度表式的东西。更接近实际的描述是:站点能承受多少并发请求、响应有多快、内容更新频率如何,共同决定了蜘蛛在一段时间内愿意来多少趟。业内习惯把这部分抓取能力叫“抓取预算”,它没有官方口径,但拿来做排查框架是够用的。
需要提醒的是,预算并不是越多越好。让蜘蛛把时间花在低价值 URL 上,和减少抓取次数,本质上是同一件事的两种表现。
先看日志:蜘蛛到底在抓什么
取最近一到两周的服务器日志,筛选主流蜘蛛的 UA,把抓取 URL 按目录和路径特征分组。重点不是总量,而是比例。
- 参数组合页占比:带 sort、filter、page 这类参数的 URL 占了多少抓取次数。
- 分页与列表:列表页、翻页页、归档页被抓的深度和频次。
- 重复路径:同一篇内容是否存在多个 URL 变体被反复抓取。
- 状态码分布:200、301、404、5xx 各占多少,响应时间集中在哪个区间。
- 新页面:最近发布的内容有没有出现在日志里,第一次被抓是什么时候。
别忘了拉长时间维度
只看一天的日志容易被误导。建议按周对比:如果总抓取量下降但新页面抓取量没变,说明能力被压缩了;如果总量不变而参数页占比上升,说明站内暴露的入口变多了。
常见的抓取消耗源
- 站内搜索结果页允许被抓,且能被外部链接或站内入口触达。
- 筛选与排序组合在列表页上无限制生成可点击链接。
- 日历、标签、作者等聚合页数量大、内容稀薄,却能无限翻页。
- 软 404:错误页返回 200,蜘蛛会反复回头确认。
- 重定向链条:内部链接指向旧地址,跳一次才到目标页。
- 响应偏慢:同样的并发下,能抓完的页面数量被拖低。
- 站点地图推送里混进了大量低价值 URL,等于主动邀请抓取。
核对顺序建议
- 按目录统计抓取分布,找出占比最高的低价值类型。
- 确认这些 URL 有没有站内入口,尤其是有没有可点击链接或站点地图条目。
- 检查服务端响应时间与错误率,技术问题优先于内容问题处理。
- 对不需要被抓的类型,先收口入口,再考虑 robots 或 noindex。
- 处理后再观察一到两周日志,看抓取是否向重要目录迁移。
不要一边在 robots.txt 里放开参数页,一边期待蜘蛛优先抓正文页。入口在哪里,抓取就会跟到哪里。
处理时容易忽略的几点
第一,收口不等于屏蔽。很多参数页是用户正常浏览路径的一部分,动手前要确认会不会影响站内体验。第二,lastmod 频繁变动会让蜘蛛重复回访,站点地图里的时间最好反映真实的内容变更。第三,抓取量上升不等于收录上升,抓得勤但页面质量不够,依然会停在“已发现”阶段。
小结
收录慢的时候,先别急着提高提交频率。用日志做一次抓取盘点,把蜘蛛实际消耗掉的机会列出来,通常比盲目提交更容易定位问题。抓取结构的调整是长期活,观察周期至少以周为单位,而不是以天为单位。