很多站长会遇到一种情况:日志里蜘蛛每天都来,但翻来覆去都是筛选页、标签页、分页,真正想被收录的产品页或文章页却迟迟没有动静。这通常不是蜘蛛“不喜欢”你的内容,而是抓取量被分配到了别的地方。
抓取预算是什么
搜索引擎不会无限量地爬一个站点。它会根据服务器响应速度、历史抓取中的错误率、内容更新频率、站点规模等因素,估算出一个相对合适的抓取频次和并发量,再把这些额度分配到站内 URL 上。这个额度常被称作抓取预算。
它不是一个固定数字,也没有公开的计算公式,更像是“蜘蛛愿意在你站上花多少时间”的粗略描述。对只有几百上千个 URL 的小站来说,预算基本够用,不必过度纠结;URL 数量上万、参数组合成倍增长的站点,才更容易看到它的影响。
真正值得警惕的信号不是“蜘蛛来得少”,而是“蜘蛛来了,却把时间花在不重要的 URL 上”。
哪些页面在消耗抓取量
- 带筛选、排序、分页、跟踪参数的 URL 组合,数量可能成百上千;
- 站内搜索结果页、日历归档页、没有实际内容的标签聚合页;
- 同一篇内容对应多个 URL 变体,蜘蛛要逐个访问才能判断是否重复;
- 重定向链、软 404、本该返回 404 却返回 200 的空页面;
- 依赖 JavaScript 渲染才有内容的页面,单次抓取的成本更高。
这些 URL 本身未必算“错误”,但当它们的数量远大于有价值页面时,就会稀释真正重要页面被访问的机会。
把抓取额度留给重要页面
从源头控制 URL 数量
筛选、排序这类参数,能用 canonical 收敛的就收敛;确实不需要被访问的组合,可以用 robots.txt 阻止抓取,减少蜘蛛在列表页上的消耗。要注意的是,robots.txt 只阻止抓取,不阻止该 URL 出现在索引里。如果目标是把页面彻底移出索引,需要允许抓取后再使用 noindex,两者不建议同时使用。
提高响应速度和稳定性
服务器响应慢、频繁超时或返回 5xx,会让蜘蛛主动降低抓取频率,而且恢复需要时间。把首字节时间控制住、减少不必要的重定向,往往比任何“技巧”都更直接有效。
用内链和 sitemap 指路
重要页面尽量从首页几次点击就能到达,深层页面靠合理的内链被带出来。sitemap 只放希望被收录的 URL,不要把全站参数和废弃页面一股脑塞进去,否则它反而变成蜘蛛的迷宫。
保证状态码和 canonical 干净
该 404 的返回 404,该跳转的用 301,不要用 200 掩盖空页面。canonical 指向要稳定且自洽,否则蜘蛛会反复访问多个版本来确认哪一个才是正本,白白消耗抓取量。
自查顺序
- 看抓取统计和服务器日志,找出蜘蛛访问量最大的路径;
- 判断这些路径是不是你希望被收录的页面;
- 排查响应时间、错误率和重定向数量;
- 查看“已发现,尚未抓取”清单里有没有重要页面;
- 做调整后,观察几周的抓取分布变化,而不是一两天就下结论。
别把抓取预算当成万能解释
如果站点只有几十个页面,蜘蛛依然不收录,问题多半出在内容质量、页面价值或入口结构上,而不是抓取预算。先确认页面本身是否值得被抓取和索引,再谈分配,顺序反了容易白忙一场。