在收录问题里,最容易混淆的一句话是“页面已经抓了,怎么还没收录”。抓取、收录、索引、展示在后台可能对应不同状态,混在一起看,排查就会乱。把同一个 URL 的四种状态拆开,很多问题会具体到某一步。
四种状态分别指什么
- 已发现:搜索引擎知道这个 URL 存在,来源可能是内链、站点地图、外链或手动提交。发现只代表进入待处理队列,不保证很快抓取。
- 已抓取:爬虫实际请求了页面,拿到了 HTML 或状态码。服务器返回 200、内容能解析,才谈得上进入下一步。
- 已索引:页面内容被解析、去重、质量判断后,进入可被检索的索引。这个阶段可能出现“已抓取但未编入索引”。
- 可展示:用户搜索某个词时,页面有机会出现在结果里。即使进了索引,也不代表每个查询都会展示。
状态对不上时,先看卡在哪一层
发现到抓取之间
常见原因是 URL 层级太深、内链太少、站点地图缺失或错误、robots.txt 屏蔽、服务器响应慢。日志里长期没有爬虫记录,先查这些,而不是反复改正文。
抓取到索引之间
页面被抓了但没进索引,常见信号包括 noindex、canonical 指向其他 URL、内容与站内或站外高度重复、页面主体内容过薄、模板化严重。此时要判断页面是否值得单独存在,而不是只改标题。
索引到展示之间
页面在索引里,但搜索品牌词或长尾词不出现,可能和查询意图、排序竞争、地域、个性化有关。用固定的查询词和不同设备多试几次,再看标题摘要是否被改写。
核对状态时,别只依赖一种方式
- 先看抓取日志,确认爬虫是否来过、返回什么状态码。
- 再看站点地图和索引状态报告,区分“已发现未抓取”和“已抓取未索引”。
- 用 URL 检查工具看具体地址的当前状态,但不要把它当成最终排名依据。
- 用站内搜索和外部搜索交叉验证,注意 site 查询本身有误差。
URL 规范和重复内容影响的是索引归集
同一内容如果存在多个地址,比如带参数、带大小写、带末尾斜杠、打印版、移动版,索引信号会被分散。处理顺序通常是:先统一 URL 写法,再用 301 把旧地址指向代表页,最后用 canonical 或 noindex 处理剩余变体。不要同时给一个 URL 加互相冲突的指令。
- 代表页只保留一个,其他变体不要都放在站点地图里。
- 筛选参数、排序参数、会话参数,能屏蔽就屏蔽,能合并就合并。
- 分页和列表页按实际价值决定是否留在索引,不要默认全收。
能主动做的几件事
把重要页面放在靠近首页的层级,用内链把 URL 串起来;站点地图只放希望被抓取的规范地址;上线新页面后观察日志和索引状态,而不是当天就下结论;对薄内容做扩充、合并或 noindex,而不是反复提交。这些动作提高的是被正常处理的机会,不保证一定收录或展示。
先确认 URL 处在发现、抓取、索引、展示中的哪一步,再决定改什么。顺序对了,收录问题才不会变成盲目改版。