抓取预算不是一份固定配额
很多站长把抓取预算理解成搜索引擎每天给的一个固定数字,其实更接近两股力量的平衡:一边是站点能承受多快的抓取速度,另一边是搜索引擎认为有多少 URL 值得来抓。前者受服务器性能、响应时间影响,后者受站点规模、内容更新频率和内部链接结构影响。站点越小,这件事越不需要操心;当 URL 数量到几万甚至几十万,尤其是站内有大量参数、筛选和搜索结果页时,就值得认真看一看了。
需要说明的是,抓取预算宽裕并不会直接带来排名,它只是让重要页面更快被发现、更快被重新抓取的一个前提条件。
哪些站点更该关注这件事
- URL 数量庞大,且由程序自动生成(电商、分类信息、论坛、聚合类站点)
- 单次抓取会触发数据库重查询、响应明显变慢的站点
- 每天发布大量内容,但新页面被抓取的时间越来越晚
- 站内搜索结果页、筛选页、排序页可以被外部直接访问
如果站点只有几百个页面,且更新节奏平稳,通常不需要专门优化抓取预算,把精力放在内容质量和基础结构上更划算。
从哪里看出抓取被浪费了
服务器访问日志
这是最直接的一手数据。按 user-agent 过滤出蜘蛛的请求,然后看三件事:每天请求总量、状态码分布、被请求次数最多的路径。如果排在前面的全是参数页、搜索结果页或者已经下线的旧地址,说明抓取确实被消耗在了低价值的地方。
抓取统计与索引状态
搜索引擎后台一般会提供抓取请求数和抓取频次的数据,可以和你自己的日志互相印证。另外可以观察一个更直观的信号:新发布的内容通常要多久才第一次被抓到,这个时间如果在变长,就值得往下查。
内链指向
蜘蛛走的是链接。如果首页、栏目页到处都链向筛选组合页,那它自然会往那个方向跑。抓取问题往往先是内链问题。
常见的抓取浪费与处理思路
- 站内搜索结果页。组合近乎无限,绝大多数没有独立检索需求,通常是抓取浪费的大头。
- 筛选与排序参数。颜色、价格区间、排序方式等组合出来的地址,内容高度相似。
- 层级过深的分页。用户很少翻到很后面,蜘蛛却会一路跟下去。
- 薄内容的标签页和聚合页。只有几条内容却单独成页,容易既无价值又占抓取。
- 空列表与软错误页。没有结果却返回 200,蜘蛛会当成正常内容反复来访。
- 会话 ID、跟踪参数。同一个页面被拆成大量不同地址。
- 打印页、分享页、临时预览地址。功能页通常不需要被抓取。
处理方式无非几种:能合并的合并,没有独立价值的加 noindex,完全不需要被访问的直接在 robots.txt 里拦掉,同时把内链从这些页面上收回来,让链接集中指向真正重要的内容。
robots.txt 屏蔽与 noindex 的取舍
这两者容易用混。简单说:不希望蜘蛛抓取、也不介意它是否收录的地址,用 robots.txt 屏蔽更省资源;希望它抓取但不要收录的页面,用 noindex。
如果先用 robots.txt 屏蔽了某个目录,蜘蛛就看不到页面里的 noindex 标签,那个标签也就不会生效。反过来,如果页面已经被收录,只加 robots.txt 屏蔽并不会让它从索引里消失。
所以站内搜索页这类既没必要收录、也没必要抓取的地址,直接屏蔽通常更干脆;而某些需要保留访问入口、但不希望出现在结果里的页面,才适合用 noindex。
一份可以照着做的自查清单
- 导出最近一周的蜘蛛请求日志,按路径统计请求次数排名。
- 标出其中的参数页、搜索页、分页深水区和已下线地址。
- 确认这些地址是否有独立检索价值或转化价值,没有就列入处理清单。
- 检查 Sitemap 是否只包含希望被收录的规范地址,避免把低价值页一并提交。
- 检查首页和栏目页的内链,是否给了低价值页面过多入口。
- 处理完两周后再看一次日志,对比请求分布是否变化。
抓取预算本质上不是一个可以单独优化的指标,它更像是站点结构清晰、内容有价值的副产品。与其一次性做大改,不如把日志养成定期查看的习惯,发现浪费就随手处理掉。