打开统计后台,看到访问量涨了一截,先别急着高兴。这些“访问”里往往混着不少搜索蜘蛛、监控探针、第三方工具爬虫,甚至还有一些扫描脚本。把它们当成真人访客,会直接影响你对内容效果、栏目价值和服务器压力的判断。这篇说的就是:怎么在统计和日志里把两类流量大致分开,以及分开之后这些数字该怎么用。
为什么这件事值得花时间
蜘蛛流量和真人流量的行为模式差别很大。蜘蛛通常是短时间集中抓取、单次会话请求页面多、停留时间极短、路径高度重复;真人则分散、有跳出、有滚动和点击。如果混在一起看,最容易出现的两个误判是:
- 误判内容受欢迎:某栏目被抓得多,可能只是因为它在列表页、站点地图或内链里被频繁指向,并不代表访客爱看。
- 误判服务器压力:流量曲线在半夜冲高,如果只按总请求数扩容,很可能是在为爬虫买单,而白天的真实高峰反而没被照顾到。
蜘蛛流量的常见特征
不同来源的爬虫行为不完全一样,但有几条共性可以参考:
- User-Agent 里带有 bot、spider、crawler 等字样,或使用已知的搜索蜘蛛标识。
- 同一 IP 或同一网段在短时间内请求大量 URL,且请求间隔非常规律。
- 几乎不加载图片、CSS、JS 之外的资源,也不执行完整的前端行为(视抓取方式而定)。
- 访问路径集中在站点地图、分页、标签页、筛选参数页这类“入口型”地址。
- 不携带引荐来源,或引荐来源固定为搜索域名、站长工具地址。
实操:把两类流量分开的三步
- 先看原始日志。统计工具已经做过一轮过滤和采样,判断“是不是蜘蛛”时不如服务器访问日志直接。挑一天的数据,按 IP、UA、请求路径做一次分组统计,心里就有底了。
- 在统计工具里建过滤器。主流统计平台都支持按 UA 或 IP 段排除。把已知的搜索蜘蛛、自家监控、常用工具爬虫加进排除规则,另建一个视图专门看这部分流量,两边对照着看。
- 定期核对名单。爬虫标识会变,新工具也会出现。建议每月抽一次日志,看看有没有新的高频 UA 或 IP 段需要补进名单,避免过滤器长期不更新。
需要提醒的是,UA 可以伪造,单靠 UA 判断并不严谨。对于动不动就刷几千次请求的来源,可以结合请求频率、是否加载静态资源、是否有会话行为一起看,比只看一个字段可靠得多。
区分之后,这些数据怎么用
看内容效果时
用真人数据判断选题和栏目价值,用蜘蛛数据判断抓取是否顺畅。比如某个新栏目真人访问一般但被抓取频繁,说明它在结构上容易被发现,问题可能出在标题、摘要或入口位置,而不是“没人看”。
看服务器和带宽时
把蜘蛛请求单独算一份。如果蜘蛛占比长期超过一半,就要回头检查是否存在参数组合页、重复列表页被大量抓取的情况,这类页面对访客价值低,却会持续消耗资源。
看收录与发现时
蜘蛛的抓取频次和路径分布,可以作为站点结构的参考信号:哪些页面从来没被访问过,往往意味着它们在内链或站点地图里太深、太偏。
自查清单
- 统计工具里是否已排除已知搜索蜘蛛和自家监控?
- 是否有一个独立视图专门看蜘蛛流量,而不是和总流量混在一起?
- 最近一个月是否核对过原始日志中的高频 UA 和 IP 段?
- 流量报表在对外汇报时,是否注明了数据口径?
- 蜘蛛请求占比异常升高时,是否有人跟进排查原因?
数据口径不统一,比没有数据更容易误导决策。先分清谁在访问,再谈涨跌。