网站收录

从服务器日志看收录卡点:状态码、抓取频次与入口路径

索引报告只给结果,服务器日志记录过程。本文讲怎么用日志里的状态码、抓取频次和入口路径,判断收录究竟卡在哪一步,并给出对应的处理顺序;同时也提醒,日志只能证明蜘蛛来过,不能证明页面会被收录。

网站收录

从服务器日志看收录卡点:状态码、抓取频次与入口路径

收录出问题的时候,多数人第一反应是去后台翻索引报告。索引报告告诉你结果是“未收录”,却不说是在哪一步断的。服务器日志恰好相反,它记录的是过程:蜘蛛什么时候来过、抓了哪些 URL、拿到了什么响应。把两者对着看,卡点通常就浮出来了。

日志里真正有用的三类信息

原始日志字段很多,做收录诊断只需要盯住三样。

状态码

200 说明页面能被正常取回;301、302 说明你在做跳转;404 和 410 是明确拒绝;5xx 与超时是服务器端的问题;429 或者频繁的 503 往往意味着你在限速。同一个 URL 反复出现 5xx,搜索引擎不会一直等下去,抓取频次会随之降下来。

抓取频次与页面分布

统计一段时间内各目录被访问的次数,能看出蜘蛛的兴趣落在哪里。如果抓取集中在列表页、标签页、参数页,而正文页寥寥无几,新内容自然难被及时发现。

入口路径

看蜘蛛是从哪个页面走到目标页的。如果某个重要页面在日志里从来没有 Referer,说明它在站内缺少可用入口,只能靠站点地图或外链被“发现”,这类页面收录慢是正常现象。

三种最常见的卡点

  • 响应不稳:页面时快时慢,或者偶发 5xx。蜘蛛抓几次都拿不到稳定结果,就会降低对这个目录的信任。
  • 抓取被低价值页面吃掉:大量参数组合、排序筛选、会话 ID 生成的 URL 被反复抓取,真正想收录的页面反而排不上队。
  • 页面没有可走通的入口:新页面只存在于站点地图里,站内没有任何链接指向它。站点地图解决的是“发现”,走不通的路径会让抓取迟迟不发生。

从日志到具体动作

  1. 先把 5xx 和超时挑出来。服务器不稳,其他问题都谈不上优先。
  2. 把被大量抓取的参数页、重复页做收敛:能合并的合并,该屏蔽的屏蔽,让抓取落到正文页上。
  3. 检查重要页面的站内入口,把链接补进导航、相关推荐或列表页,给它一条真实路径。
  4. 对比日志里的抓取时间和索引报告里的收录时间,看间隔是几天还是几周。间隔很长,说明发现到抓取之间有问题;抓取很快却一直不收录,问题多半在页面本身。
日志只能证明蜘蛛来过,不能证明页面会被收录。抓取是收录的必要条件,不是充分条件。

几个容易误读的地方

日志里出现蜘蛛 IP,不代表页面被索引了,只代表被访问过。反过来,日志里没看到某个页面被抓,也不一定是坏事,可能只是它还不值得抓,或者抓取周期还没轮到。

另外要注意区分不同爬虫:Googlebot、Bingbot 以及各类抓取工具的用途并不相同,统计时最好按 UA 分开看,否则频次数据会被混在一起,判断就容易失真。

如果站点规模不大,日志分析不必做得太复杂。每周导出一次日志,筛出搜索引擎 UA,按状态码和目录做个简单汇总,几十行结论就够指导下一步动作了。