在做站点运营时,“蜘蛛来过”常被当成收录的前兆:日志里出现了抓取记录,就以为页面迟早会出现在搜索结果里。实际上一段时间后再去查,页面依然没有索引。抓取和收录是两个独立的环节,前者解决“搜索引擎有没有拿到这份内容”,后者解决“这份内容值不值得放进索引”。把两者混在一起看,排查方向很容易跑偏。
抓取和收录各自在做什么
抓取阶段,搜索蜘蛛按 URL 找到页面、发起请求、取回响应内容,可能还会顺带发现页面里的链接。这个过程只说明爬虫成功访问过服务器,内容是否被保存、保存多久、是否用于索引,都不由抓取本身决定。
收录阶段,搜索引擎要把抓取到的内容做质量判断、去重、选版本,再决定是否放进索引、放进哪个索引。这个阶段会参考内容本身的完整度、与其他页面的相似程度、站点的整体可信度以及页面对用户是否有明确价值。抓取成功只是入场,收录是筛选。
常见的误判
- 日志里有 200 状态码的抓取记录,就认为页面一定会被收录。
- 用抓取工具请求页面返回正常,就认为搜索引擎侧也没有障碍。
- 看到抓取频次上涨,就推断收录量会同步上涨。
这些推断都跳过了收录环节的判断。抓取频率更多反映的是搜索引擎对该站点的兴趣和预算分配,与单个页面最终能否进入索引没有直接对应关系。
页面被抓取但不收录,通常卡在哪
- 访问层面的限制。页面返回了非 200 状态、robots.txt 屏蔽了该路径、页面带 noindex 或响应头里有 X-Robots-Tag,这些都会让抓取结果无法进入后续流程。注意 robots.txt 本身不阻止收录,它阻止抓取;真正决定不收录的是 noindex 之类的指令。
- 内容层面的判断。正文过短、大量模板文字、与站内其他页面高度相似、同一内容存在多个地址,都可能让搜索引擎选择一个更“标准”的版本,或者干脆不纳入索引。
- 版本与状态不一致。页面对爬虫返回 200,对用户却是跳转、弹窗或空白,这种不一致长期存在会持续消耗信任。
- 发现路径薄。只靠站点地图提交,站内没有有效内链指向,抓取频次会很低,收录自然慢。
按什么顺序排查
先确认页面在抓取层面是否通畅:状态码、robots 规则、meta 与响应头设置。再看内容是否具备独立价值:正文是否完整、是否与既有页面重复、标题和主体是否一致。最后看发现与入口:站内链接是否可达、站点地图是否准确、是否有外部链接指向。这三步的先后顺序不要颠倒,因为前一步的问题会掩盖后一步的现象。
可以借助的信号
- URL 检查类工具里的“已抓取”“已发现”“已编入索引”状态,用来区分卡在哪一环。
- 服务器日志里的抓取时间与频次,判断发现路径是否通畅。
- 索引覆盖率类报告里的排除原因,按原因归类处理,而不是逐个页面对付。
抓取记录只能说明蜘蛛来过,不能说明页面会被收录。把抓取、内容判断、发现路径分开核对,比反复提交 URL 更有效。
最后一点提醒:收录是结果,不是可以直接索取的动作。与其反复催促抓取,不如把页面的主体内容、链接结构和唯一性做扎实,让搜索引擎在判断时有明确的依据。