网站收录

主站之外还有一堆域名被收录:镜像、测试与历史域名的清理顺序

同一站点出现多个域名被收录,多半来自 www 与裸域并存、备案前的测试域名、云服务商默认地址或外部镜像站。本文按来源分类,说明哪些适合用 301 合并、哪些应该用 noindex 或服务器层隔离,以及 robots.txt 屏蔽与 noindex 混用时的顺序问题,并给出一个可以按周推进的清理顺序。

网站收录

主站之外还有一堆域名被收录:镜像、测试与历史域名的清理顺序

不少人检查收录时会发现,自己只运营一个站点,但搜索里能搜出好几个域名:带 www 的、不带 www 的、备案前用的测试域名、云服务商默认给的二级域名,甚至是别人的镜像站。这些地址如果都有可访问的内容,索引里就会出现多份重复版本,收录数据和访问信号也会被分散。处理这类问题,重点不是一次删干净,而是先分清每个域名属于哪一类,再决定用哪种方式收口。

先搞清楚这些域名从哪来

同一套内容对应多个域名,常见的来源大致有几类:

  • 主域名的变体:www 与裸域、http 与 https,往往因为不同时期配置不一致而同时可访问。
  • 测试与预览地址:上线前的 staging 域名、测试服务器 IP、托管平台自动生成的临时域名。
  • 托管商或 CDN 默认域名:接入过程中系统分配的地址,未做限制时会被外部链接和抓取发现。
  • 历史域名与旧品牌域名:公司更名、换品牌后停用但没有做跳转的域名。
  • 外部镜像与采集站:不受你控制,通常是整站复制或定时抓取你的内容。

分类的意义在于:前几类你能直接操作,最后一类只能通过内容归属和发布节奏去区分,处理方式完全不同。

把范围列清楚:三个来源交叉核对

不要凭印象判断,用下面几种方式把域名清单列出来:

  1. 用 site: 查询逐个域名,看是否有页面被索引。搜索结果数量只是粗略参考,重点看哪些域名确实有内容被收录。
  2. 看服务器日志里的 Host 字段,按域名分组统计请求量。抓取工具的请求通常集中在少数域名上,能看出哪个域名还在被持续访问。
  3. 在站长平台的链接或流量数据里核对,看外部链接指向的是哪个版本,这些链接往往就是索引里多版本长期存在的原因。

能合并的合并,不能合并的隔离

可以一一对应跳转的,用 301

旧域名和主站的页面结构一致时,做一一对应的 301 是最直接的方式:旧域名某个页面跳到主站对应页面,而不是全部跳到首页。全站跳到首页容易被当成无效目标,长期看对收录归属也没有帮助。跳转上线后,内链和站点地图里的地址同步换成主域版本,减少新的信号指向旧地址。

测试与预览域名,先 noindex 再谈屏蔽

这类域名通常不需要保留任何收录价值,但也不能直接关掉,否则后续无法确认状态。常见做法是允许抓取、返回 noindex,等索引里的 URL 逐步消失之后,再决定是否在服务器层限制访问。

这里有个容易踩的顺序问题:如果一开始就在 robots.txt 里整站屏蔽,抓取工具读不到页面上的 noindex,索引里反而可能长期留着这些 URL。屏蔽和 noindex 是两种不同机制,处理“不该被收录的地址”时不要同时用错。

外部镜像站,控制不了就做区分

镜像和采集站一般不归你管。能做的通常是确认自己是不是内容的原始发布方,保持稳定的更新节奏和站点结构,让同一个内容在两边的差异足够明显。不要指望对方主动消失,也不要把希望完全寄托在投诉上。

一个可以按周推进的清理顺序

  1. 先处理自己能完全控制的重复版本,比如 www 与裸域、协议与端口不一致的地址。
  2. 再处理测试域名和托管商默认域名,统一先做 noindex,观察索引数量变化。
  3. 最后处理历史域名,确认没有仍在使用的业务地址后,再逐个改成 301。
  4. 每完成一步,回看日志里各 Host 的请求分布,确认信号是否真的转移了。

几个容易忽略的细节

  • 只在站点地图里删掉旧地址,但没有改跳转或加 noindex,索引里的记录不会因此消失。
  • 用 302 做长期跳转,地址归属可能会一直不稳定,能用 301 就不要用临时跳转。
  • 旧域名上还有可访问的独立内容时,要先判断这些内容是否还需要保留,而不是一律跳走。
  • 清理过程中收录数量出现波动是正常现象,不必因为一两天的变化就临时改方案。
域名层的动作和页面层的动作生效节奏不同,索引更新通常滞后。建议按周观察日志和索引数据,而不是每天盯着数字调整策略。