网站收录

站点改版或更换域名:收录过渡期该做哪些准备

站点改版或更换域名时,收录表现出现波动并不意外。本文从新旧 URL 映射、301 跳转规则、sitemap 与 robots 的处理、过渡期观察指标几个方面,梳理迁移过程中容易踩的坑,并给出一份可执行的检查清单。

网站收录

站点改版或更换域名:收录过渡期该做哪些准备

站点改版或者更换域名,往往是在业务需要下做出的决定,但对搜索引擎来说,这意味着它熟悉的地址、结构和内容组织方式同时发生了变化。收录表现出现波动是正常的,关键在于把波动控制在可解释、可恢复的范围内。

先分清改版和迁移

这两件事对收录的影响路径并不相同。

  • 改版:域名不变,改的是模板、栏目结构、URL 形式或内容组织方式。影响主要集中在 URL 是否变化、内链是否重排、页面主体内容是否被替换。
  • 迁移:域名或目录层级发生变化,页面地址整体换了一套。除了结构问题,还要处理新旧两套地址之间的交接。

如果只是换配色、调排版、加侧栏,URL 不动、正文不动,通常不需要做额外的收录处理;真正麻烦的是 URL 变了。

迁移前要把映射表定下来

迁移最容易出问题的地方,是旧地址和新地址没有一一对应。跳转规则往往靠正则批量生成,一旦规则写错,就会出现某些栏目整体跳到首页的情况。

  1. 导出旧站所有可访问的 URL,去掉参数、分页和已下线的地址,得到一份干净的清单。
  2. 为每一条旧 URL 指定一个新 URL;确实没有对应内容的,明确是合并到某个栏目页,还是直接返回 404。
  3. 跳转规则按映射表生成,而不是反过来用规则去猜映射关系。
  4. 新旧 sitemap 分开维护,新站点地图只放新地址。

301 跳转的几个常见误区

  • 链式跳转:A 跳到 B,B 又跳到 C。多跳一层,传递效果就会打折扣,最好直接跳到最终地址。
  • 一律跳首页:内容不对应,蜘蛛会认为旧页面没有合适的新归属,关联关系也就断了。
  • 用 JS 或 meta refresh 代替 301:这类跳转在识别和处理上都更慢,能返回状态码就用状态码。
  • 旧域名直接停止解析:跳转还没生效或还没被处理完,旧地址就全部变成了无法访问,等于把之前的积累直接丢掉。

域名不变、只改 URL 的情况

这种场景其实和迁移的处理方式一样,只是少了域名交接这一环。原则是能不动 URL 就不动:把模板、样式、导航、内链结构调整好,往往就能解决大部分体验问题。如果确实要改,就当作一次小规模迁移来做,逐条 301,同时把站内所有指向旧地址的链接、sitemap 和对外投放的链接都替换掉。

过渡期该看什么

跳转上线之后,短时间内可能出现旧地址仍在索引里、新地址迟迟不出现、展示量下滑等现象,这是过渡期的常态。可以关注几类信号:

  • 抓取日志中新地址的抓取比例是否在上升,旧地址是否在下降。
  • 站点地图中的新地址被发现的进度。
  • 索引里新旧地址同时存在的情况,是否存在内容重复。
  • 搜索结果的落地页是否逐渐从旧地址切换到新地址。
过渡期以周为单位观察比较合理,站点规模越大,切换过程通常越长。用一两天的数据下结论,很容易误判。

容易踩的坑

  1. 新旧站点同时在线、同时可访问、内容一致,却没有做规范化处理,形成重复内容。
  2. 新站的 robots.txt 沿用了测试环境配置,把不该屏蔽的目录挡掉了。
  3. 旧 sitemap 没有下线,蜘蛛还在按旧地址抓取。
  4. 跳转漏掉了非 HTML 资源、分页和带参数的地址。
  5. 新域名上线后抓取频繁,服务器响应变慢,反过来拖慢了收录节奏。
  6. 迁移和大幅改内容同时进行,出问题时很难判断是哪一环导致的。

一份简化的检查清单

  1. 映射表完整,每条旧 URL 都有明确归宿。
  2. 301 为单跳,指向内容对应的新地址。
  3. 新站 sitemap 已提交,旧 sitemap 已移除或标记失效。
  4. 站内链接、canonical、分页关系都指向新地址。
  5. robots.txt 允许抓取,且没有被测试配置污染。
  6. 旧域名的解析和跳转至少保留数月,直到抓取日志中旧地址明显减少。
  7. 迁移与内容大改尽量错开排期。

把迁移当成一次有计划的交接,而不是上线即完成的任务,收录的过渡通常会平顺很多。真正需要耐心的部分往往在跳转上线之后,而不是之前。