网站收录

蜘蛛来得勤,收录却不动:抓取频次和索引状态不是一回事

蜘蛛每天来、页面反复被抓,索引里却没有新增,问题往往不在抓取频次。本文把抓取和收录分开看,梳理抓取预算被哪些 URL 吃掉,并给出用日志对照索引状态、按顺序收口的排查步骤。

网站收录

蜘蛛来得勤,收录却不动:抓取频次和索引状态不是一回事

抓到和收录是两件事

服务器日志里蜘蛛几乎天天来,页面被反复抓取,但索引状态里始终没有新增,这种落差很常见。原因在于抓取只是蜘蛛把内容读走,收录是搜索引擎判断这份内容值不值得放进索引、要不要在结果里展示。中间的判断标准是内容质量和重复度,不是抓取次数。

把这两个指标混在一起看,很容易得出错误结论:以为蜘蛛来得少,就拼命提升抓取频次;实际上问题可能出在被抓的那些页面本身没有单独收录的价值。

抓取频次高,收录却不动,通常卡在三个地方

  • 页面本身不值得单独立索引:内容极少、与主页面高度重合的副页面、纯筛选结果页,即使被抓很多次也不会进索引。
  • 同一批内容被拆成多个 URL:大小写、结尾斜杠、带追踪参数的版本,被抓的是这一堆,索引里通常只保留其中一个代表。
  • 抓取入口太集中:蜘蛛一直围着首页、栏目页和几个热门详情页转,新页面根本没被走到,日志里自然看不到。

抓取预算容易被谁吃掉

蜘蛛在一个站点上的抓取量有上限,浪费在低价值 URL 上,真正需要被发现的新页面就分不到额度。

  • 站内搜索结果页,以及排序、筛选组合出来的参数 URL;
  • 已经 404 或 410、但仍有大量内链指向的旧地址;
  • 要经过多层重定向才能到达终点的链接;
  • robots.txt 已屏蔽、内链却还继续指向的目录;
  • 翻到几十页之后、本身没有独立价值的列表页。

这些 URL 不一定马上带来问题,但它们每次被访问都会消耗一次抓取,挤压新内容的发现机会。数量越积越多,日志看上去很热闹,实际有效抓取并没有增加。

用日志和索引状态对一遍

  1. 从日志里筛出蜘蛛访问过的 URL,按目录和参数类型分组,看抓取量集中在哪一类。
  2. 把抓取量最高的那批 URL 拿去查索引状态,区分「抓了没收」和「收了但没有展示」。
  3. 再对照最近发布的新页面,看它们第一次被抓距发布隔了多久,是否有稳定入口能到达。
  4. 把「抓了很多次且一直没收」的类别标记出来,这就是下一轮要处理的对象。

调整动作的顺序

先别急着做新的内容堆量。更有效的顺序是:先把不该被抓的 URL 收口,比如屏蔽无意义参数组合、清理失效链接、统一重复版本,让抓取集中到有收录价值的页面上;再检查这些页面的内链入口是否通畅,保证新页面发布后能在较短时间被走到。

别把抓取频次当成考核指标

抓取频次会因为站点体量、内容更新节奏、页面权重而自然波动。它上升不代表收录会变好,下降也不等于出了问题。真正需要盯的是:新页面多久被发现、有多少 URL 反复被抓却始终进不了索引、索引里的页面能不能拿到展示。盯这些结果,比盯蜘蛛来了几次更有意义。

抓取频次是过程指标,收录和展示才是结果。排查时先看结果,再回头看过程哪里卡住。