很多站长看抓取日志时,只关注蜘蛛有没有来。但更值得看的是:蜘蛛把时间花在了哪些 URL 上。抓取资源不是无限供应,如果大量低价值 URL 被频繁抓取,真正希望被收录的页面就会排得更靠后。
抓取预算不是固定配额,但会被分摊
搜索引擎没有公开一个固定数值的“抓取预算”,但抓取频率确实受站点规模、更新频率、服务器响应速度、页面质量等因素影响。可以把它理解成一种动态分配:蜘蛛愿意给这个站多少抓取机会,以及这些机会怎么分。低价值 URL 拿得越多,有效页面拿到的就越少。
从日志里找出高频消耗项
先按蜘蛛 UA 过滤日志,再按 URL 聚合请求次数、状态码和平均响应时间。重点看那些被抓取很多、但从未带来搜索流量的路径。
- 分页链接:page/2 之后的页面如果内容重复,通常不值得反复抓取。
- 筛选和排序参数:?color=red&size=m 这类组合容易生成大量相似 URL。
- 标签和聚合页:内容稀薄、互相重复时,会持续消耗抓取。
- 站内搜索结果页:参数化 URL 大多没有独立收录价值。
- 会话 ID 和追踪参数:同一页面出现多个 URL 版本。
- 404 和重定向链:蜘蛛反复访问旧链接,会占用抓取机会。
- sitemap 中的低价值 URL:主动提交等于主动引导抓取。
判断低价值的两个标准
一是这个 URL 有没有独立的搜索需求;二是它与其他页面是否高度重复。两者都不满足时,通常不值得占用抓取资源。
收敛顺序:先堵入口,再清 sitemap
- 内部链接:先移除或减少指向低价值 URL 的入口,尤其是全站导航和页脚。
- robots.txt:对确定不收录的目录或参数做 disallow,注意不要误封需要抓取的 CSS、JS 和图片。
- canonical:对保留但重复的页面,指向主版本,帮助搜索引擎合并信号。
- sitemap:只保留希望被收录的 URL,移除参数页、聚合页和已失效链接。
- 服务器端:对确认无价值的 URL 返回 410,或 301 到相关的主页面,减少反复抓取。
顺序有讲究。只清 sitemap 但内部链接还在大量输出,蜘蛛仍会从别处发现这些 URL。只做 robots 而不清理服务器响应,已发现的 URL 也可能继续产生抓取请求。
收敛后观察什么
观察日志中目标页面的抓取频次、状态码和首次发现时间。不要期待调整后立刻收录,抓取和索引更新都需要周期。同时检查目标页面是否响应过慢,服务器延迟本身也会影响抓取频率。
抓取优化的目标不是让蜘蛛来得更多,而是让蜘蛛把时间花在真正希望被收录的 URL 上。
常见误区
- 用 robots 一刀切屏蔽所有参数,结果误伤正常页面。
- 只清理 sitemap,内部链接和导航仍在输出低价值 URL。
- 把抓取量当成收录量,忽略页面质量和重复内容问题。
- 反复提交低价值 URL,以为能加速收录,反而挤占有效抓取。
先从日志里找出消耗抓取最多的那几类 URL,再决定收敛顺序。每次只改一两项,观察一个周期后再调整,比一次性大规模屏蔽更稳妥。