做收录排查时,抓取、索引、能被搜到这三件事经常被当成同一件事。实际上它们分属不同阶段,出问题时的信号和核对方式也不一样。分清楚卡在哪一段,比反复提交 URL 更有用。
三个阶段的差别
抓取:蜘蛛把页面下载了
抓取是可观察的动作:蜘蛛请求了某个 URL,服务器返回了内容,日志里留下记录。抓到只说明内容被取走,不代表内容被接纳。日志有访问、状态码是 200,只能证明抓取这一环是通的。
索引:内容被解析并建立条目
抓到的内容会被解析、去重、做质量与规范化判断,再决定是否建立索引条目。这一步常见的结果有三种:正常建立、以另一个 URL 为准(规范化到别处)、被忽略。页面被抓过很多次却始终没有索引状态,通常卡在这里,而不是抓取环节。
能被搜到:查询时被召回
即使建立了索引条目,也不代表某个具体查询一定会展示它。相关性、同类页面数量、内容时效都会影响结果。搜某个词搜不到,可能是展示层面的问题,而不是页面根本没被收录。
各自的核对方式
- 抓取:看服务器日志或抓取统计里的请求记录,重点关注状态码、时间分布和请求的 URL 类型。
- 索引:用站长工具类的 URL 检查,或用 site: 加上完整地址做粗判。注意 site: 的结果数是估计值,不适合当准确收录量。
- 能被搜到:用页面上独有的长句去搜,比用短关键词更接近真实情况。
三种方式各有误差,交叉验证比单看一个数字更可靠。特别是收录量这类指标,不同工具的统计口径本来就不一致,看趋势比看绝对值有意义。
建议的排查顺序
- 先确认有没有抓取记录。完全没有请求,问题在发现入口,比如内链位置、站点地图、外部链接。
- 有抓取但没索引,再看页面本身:主内容是否完整、是否与站内其他 URL 高度重复、可索引信号是否写对。
- 有索引但搜不到,回到查询本身:换用页面独有句子测试,并接受展示位置本身就有波动。
把抓取量、索引量、搜索可见度当成三个独立指标来看,比混在一起讨论“收录好不好”更容易找到下一步动作。
几个常见误区
- 把日志里的蜘蛛请求数当成收录数。
- 把 site: 结果数当成精确收录量,并据此判断涨跌。
- 认为进了索引就等于有排名,把两类问题混在一起处理。
- 页面被抓取过一次,就默认收录这件事已经完成。
收录是一条分段链路,每一段的判断依据不同。与其反复提交,不如先确定当前卡在哪一段,再针对那一段做动作。多数时候,定位准确比操作数量更能推动结果。