网站收录

抓取和收录是两回事:用一个页面走一遍判断流程

很多站长看到日志有蜘蛛请求,就认为页面会被收录,其实抓取只是第一步。本文按抓取、渲染、规范化、质量判断的顺序,梳理页面从被访问到进入索引之间可能卡住的环节,并给出日常排查时该看哪些数据。

网站收录

抓取和收录是两回事:用一个页面走一遍判断流程

经常有这种情况:日志里能看到蜘蛛来抓过页面,返回 200,但过了一段时间,在搜索结果里仍然找不到这个 URL。于是有人判断“蜘蛛不收录”,或者反复提交、调整参数。其实更准确的说法是:抓取和收录是两个状态,蜘蛛来过只说明抓取环节发生过,并不代表页面已经进入索引。

抓取和收录分别指什么

抓取,是搜索引擎的爬虫按照 URL 去获取页面内容的过程。它关心的是能不能访问、返回什么状态码、内容是否可渲染。收录,则是页面经过分析后进入搜索索引,可以在结果中被检索到。两者之间还有若干判断环节,不能直接画等号。

抓取是“来过”,收录是“留下来”。来过不一定留下来,留下来之前还会被反复评估。

从抓取到收录,中间可能卡在哪

一个 URL 从被发现到进入索引,通常会经过这些环节。任何一环不通过,都可能停在“已抓取,未收录”或“已发现,未抓取”的状态。

  • URL 发现:内链、sitemap、外链等路径是否能把 URL 送到蜘蛛面前。
  • 抓取:服务器是否稳定响应,robots.txt 是否放行,状态码是否正常。
  • 渲染:如果主要内容依赖 JS,渲染失败会让蜘蛛看到空页面或残缺内容。
  • 内容提取:正文、标题、摘要等能否被清晰识别,还是被大量模板、弹窗、无关模块淹没。
  • 规范化:多个 URL 指向近似内容时,搜索引擎需要判断哪个是主版本。
  • 质量判断:页面是否提供独特信息,是否与站内已有页面高度重复。

这些环节并不总按固定顺序发生,也不是一次判断就永久定论。但排查时按这个顺序看,通常比盲目提交 URL 更有效。

日常排查可以看哪几个地方

先看抓取日志和状态码

确认蜘蛛是否真的来过、频率如何、返回的是 200 还是 3xx、4xx、5xx。如果日志里只有少量请求,重点应放在 URL 发现和内链上;如果请求频繁但返回异常,先修服务器和状态码。

再看索引报告和 site 查询

索引报告里的“已发现”“已抓取但未编入索引”“已排除”等状态,能帮助区分问题出在抓取前还是抓取后。site 查询可以作为辅助,但不等于完整的索引数据,不宜只凭它下结论。

最后回到页面自身

检查标题和正文是否清晰,是否与站内其他页面高度相似,canonical 是否指向自己或正确的主版本,重要内链是否可达。页面质量问题和规范化问题,往往不会在日志里直接暴露,却会持续影响收录结果。

几个容易误判的情况

  • 抓取频次高不等于收录好:蜘蛛可能只是在反复确认,或者抓取的是低价值页面。
  • 提交 sitemap 不等于收录:sitemap 主要帮助发现 URL,是否抓取和收录仍要看其他条件。
  • 页面更新后旧版本还在:索引更新需要时间,短期看到旧标题或旧摘要并不一定异常。
  • 收录量波动就急着改站:日常小幅波动可能来自索引调整,先观察再决定是否排查。

一个可执行的检查顺序

  1. 用日志确认蜘蛛来过没有,返回状态是否正常。
  2. 确认页面不需要登录、没有被 robots.txt 拦住、没有错误的重定向。
  3. 检查渲染后主要内容是否可见,标题和正文是否完整。
  4. 查看 canonical、参数、大小写等 URL 写法是否收敛到主版本。
  5. 对比站内近似页面,判断是否存在重复或低价值问题。
  6. 确认内链和 sitemap 能把 URL 送到蜘蛛可发现的路径上。
  7. 完成以上检查后,给索引更新留出观察时间,不要频繁改动同一批页面。

抓取是收录的前提,但收录不是抓取的必然结果。把“蜘蛛来过”和“页面已收录”分开看,排查时就不会只盯着日志或只盯着 site 查询,而是能顺着抓取、渲染、规范化、质量这条线,找到真正卡住的位置。