收录这件事,很多人习惯一页一页去查。但如果整站收录率长期偏低,逐页排查往往效率不高——因为问题可能根本不在单个页面上。
抓取和索引是两套判断。爬虫愿不愿意来、愿不愿意抓,更多是站点层面的结果;抓到之后编不编入索引,才落到页面层面。把这两层混在一起看,很容易把站点问题当成页面问题反复折腾。
先看比例,再看绝对数
已收录数量本身说明不了什么。一个 500 页的站收录 300 页,和一个 5 万页的站收录 3 万页,前者的问题通常更值得先处理。
- 已提交的 URL 数 对比 实际被发现的 URL 数
- 被发现的 URL 数 对比 被抓取的 URL 数
- 被抓取的 URL 数 对比 编入索引的 URL 数
每一段落差对应的原因不一样。发现多、抓取少,问题多半在站点;抓取多、索引少,问题更可能在页面。
站点级问题的常见表现
抓取量被无效 URL 吃掉
参数页、筛选页、日历页、站内搜索结果,这类 URL 数量容易在短时间内膨胀。爬虫的抓取量是有限的,被这些页面占满之后,真正需要收录的内容页反而排不上队。
整体质量评价偏低
搜索引擎对站点有一个整体判断。当站内大量页面内容稀薄、模板高度雷同、或者主要靠拼凑整合而成时,这个判断会影响到新页面的收录速度,即使新页面本身做得不错。
单页质量决定它值不值得被收录,站点质量影响它多快被考虑到。两者不是替换关系。
怎么区分是站点问题还是页面问题
一个简单的办法:拿站内几个结构、内容深度都正常的老页面,看它们的收录状态。
- 老页面收录正常,只有新页面进不去,更可能是抓取节奏或新页面自身的问题
- 老页面也开始掉,或者一直没收全,更可能是站点层面的问题
- 同类模板的页面收录情况高度一致,说明模板层面有共性问题
- 表现零散、没有规律,逐页看反而更有效率
自查顺序
- 先用站点地图和日志,把发现、抓取、索引三段数据分开看,不要混着判断。
- 确认 robots.txt、noindex、canonical 没有拦住不该拦的页面。
- 统计站内 URL 总量,看看有多少是参数、排序、筛选这类低价值页面,该收敛的收敛。
- 抽查内容页的正文是否有实质性差异,模板重复度过高的部分考虑合并或改写。
- 再看内链:重要页面是否还有足够入口,层级是否过深。
这个顺序的逻辑是先排除被挡住和被稀释两种情况,再去动页面本身。反过来做,很容易在页面上改了一轮,站点结构的问题仍然摆在那里。
不要指望一步到位
站点层面的信号调整,见效周期通常以月计,而且不会因为做对一件事就立刻改变。与其盯着收录数字每天波动,不如把注意力放在 URL 总量是否收敛、内容是否有区分度这两件事上。
另外,收录数量也不是越多越好。一批本身没有检索价值的页面进了索引,对整站未必是加分项。该收的收全,不该收的挡在外面,这个平衡比单纯追求数量更有意义。