网站收录

测试站与镜像域名被收录:上线前后的收口顺序与常见遗漏

测试子域、纯 IP、旧域名被收录,多数是上线流程里少了一步收口。本文按访问层限制、noindex、robots、重定向、链接清理的顺序梳理处理步骤,并说明 robots 与 noindex 用反后页面为什么仍会留在索引里。

网站收录

测试站与镜像域名被收录:上线前后的收口顺序与常见遗漏

测试环境、旧域名、纯 IP 访问的页面出现在搜索结果里,是站点运营中很常见的一类问题。它和页面质量、内容重复关系不大,多数时候是上线流程里少了一步收口。处理这类问题的关键在于:先分清是哪一个域名或哪一类访问方式被收录,再按顺序做限制、重定向或移除。

先分清是哪一类不该被收录的地址

不同类型的地址,处理方式不一样,混在一起改容易漏。

  • 测试子域:staging、test、dev、beta 等前缀的域名或子域。
  • 纯 IP 访问:服务器直接用 IP 提供同一套内容。
  • CDN 或对象存储别名:回源域名、临时预览域名被外部引用后被抓取。
  • 旧域名与备用域名:品牌更换、站点迁移后仍然可以访问的旧地址。
  • 协议与端口变体:http 与 https 同时可访问,或带端口的地址。

上线前的收口顺序

顺序比动作本身更重要,先做访问层限制,再谈页面里的 meta 指令。

  1. 先在访问层挡住:内网访问、Basic Auth、IP 白名单任选其一,这是最彻底的一层。
  2. 再补 noindex:如果测试站确实需要对外可访问,例如给客户预览,至少保证页面返回 noindex,并且不要让它出现在任何公开链接里。
  3. 检查 robots.txt 的位置:robots 要放在对应子域的根目录,写在主站上对子域不起作用。
  4. 确认没有外部入口:分享链接、协作工具、第三方截图、外链都可能把 URL 递出去。
  5. 上线时做替换:测试地址不要直接删掉就完事,能对应到正式页面的做 301,没有对应页面的用 410 更明确。

robots 与 noindex 的顺序容易弄反

一个常见误区是:既在 robots.txt 里禁止抓取,又想靠 noindex 让页面退出索引。抓取被禁止之后,搜索引擎读不到页面里的 noindex,页面可能因为外部链接仍然保留在索引中,只是缺少摘要信息。

更稳妥的做法是二选一:

  • 要彻底不公开:在访问层限制,让它对搜索引擎和普通用户都不可达。
  • 要允许访问但不想被收录:不屏蔽抓取,改用 noindex。

已经被收录了,接下来按这个顺序处理

  1. 核对现状:确认是哪个域名、哪类 URL 进了索引,是主站被镜像,还是子域被单独收录。
  2. 切断可访问性:能 301 的做 301,不能的返回 404 或 410,避免一直返回 200。
  3. 提交移除请求:用搜索平台的移除工具处理紧急情况,同时提交更新后的页面或站点地图。
  4. 清理内外部链接:站内导航、页脚、旧文章里的链接最容易漏。
  5. 持续观察:索引更新有延迟,通常需要数天到数周,期间定期核对即可。
移除请求只是加速手段,不是删除按钮。真正决定页面能否退出的,是它是否还可访问、是否还有指向它的链接。

镜像域名与多域名绑定

同一套内容绑定了多个域名时,先确定一个主域,其余域名做 301 指向主域的对应页面,并保证主域页面 canonical 指向自身。不要出现 A 域 canonical 指向 B 域、B 域又指回 A 域的情况,这会让收录归属反复摇摆,也让蜘蛛在两个地址之间来回抓取。

上线后值得固定核对的几项

  • 测试子域是否仍能通过公网直接打开。
  • http 与 https、带 www 与不带 www 是否只有一个版本可正常访问。
  • 站点地图里是否混入了测试环境的 URL。
  • 页面模板里是否因为环境切换漏掉了 noindex 或 canonical。
  • 换域名或改版之后,旧地址是否还返回 200。

这类问题几乎都能在流程上解决:把访问层限制、noindex、重定向、链接清理放进上线检查表,按顺序执行,比事后一个个提交移除要省事得多。收录状态本身会有延迟,核对时以页面的可访问状态为准,不必因为一两天没有变化就反复改动配置。