不少人检查收錄时會發現,自己只运营一個站点,但搜尋里能搜出好几個域名:带 www 的、不带 www 的、备案前用的測試域名、云服務商預設给的二級域名,甚至是別人的镜像站。這些地址如果都有可訪問的内容,索引里就會出現多份重复版本,收錄資料和訪問信号也會被分散。處理這類問题,重点不是一次删干净,而是先分清每個域名属于哪一類,再决定用哪種方式收口。
先搞清楚這些域名從哪来
同一套内容對應多個域名,常见的来源大致有几類:
- 主域名的變体:www 與裸域、http 與 https,往往因為不同时期配置不一致而同时可訪問。
- 測試與预览地址:上线前的 staging 域名、測試服務器 IP、托管平台自動生成的临时域名。
- 托管商或 CDN 預設域名:接入過程中系統分配的地址,未做限制时會被外部連結和抓取發現。
- 歷史域名與舊品牌域名:公司更名、換品牌後停用但没有做跳轉的域名。
- 外部镜像與采集站:不受你控制,通常是整站複製或定时抓取你的内容。
分類的意义在于:前几類你能直接操作,最後一類只能通過内容归属和發布节奏去区分,處理方式完全不同。
把范围列清楚:三個来源交叉核對
不要凭印象判断,用下面几種方式把域名清單列出来:
- 用 site: 查询逐個域名,看是否有頁面被索引。搜尋结果數量只是粗略參考,重点看哪些域名确實有内容被收錄。
- 看服務器日誌里的 Host 字段,按域名分组統計請求量。抓取工具的請求通常集中在少數域名上,能看出哪個域名還在被持續訪問。
- 在站長平台的連結或流量資料里核對,看外部連結指向的是哪個版本,這些連結往往就是索引里多版本長期存在的原因。
能合並的合並,不能合並的隔离
可以一一對應跳轉的,用 301
舊域名和主站的頁面结构一致时,做一一對應的 301 是最直接的方式:舊域名某個頁面跳到主站對應頁面,而不是全部跳到首頁。全站跳到首頁容易被当成無效目标,長期看對收錄归属也没有帮助。跳轉上线後,内鏈和站点地图里的地址同步換成主域版本,减少新的信号指向舊地址。
測試與预览域名,先 noindex 再谈屏蔽
這類域名通常不需要保留任何收錄價值,但也不能直接關掉,否則後續無法確認狀態。常见做法是允许抓取、返回 noindex,等索引里的 URL 逐步消失之後,再决定是否在服務器层限制訪問。
這里有個容易踩的顺序問题:如果一開始就在 robots.txt 里整站屏蔽,抓取工具讀不到頁面上的 noindex,索引里反而可能長期留着這些 URL。屏蔽和 noindex 是两種不同机制,處理“不该被收錄的地址”时不要同时用错。
外部镜像站,控制不了就做区分
镜像和采集站一般不归你管。能做的通常是確認自己是不是内容的原始發布方,保持稳定的更新节奏和站点结构,让同一個内容在两邊的差异足够明顯。不要指望對方主動消失,也不要把希望完全寄托在投诉上。
一個可以按周推進的清理顺序
- 先處理自己能完全控制的重复版本,比如 www 與裸域、协议與端口不一致的地址。
- 再處理測試域名和托管商預設域名,统一先做 noindex,观察索引數量變化。
- 最後處理歷史域名,確認没有仍在使用的业務地址後,再逐個改成 301。
- 每完成一步,回看日誌里各 Host 的請求分布,確認信号是否真的轉移了。
几個容易忽略的细节
- 只在站点地图里删掉舊地址,但没有改跳轉或加 noindex,索引里的记錄不會因此消失。
- 用 302 做長期跳轉,地址归属可能會一直不稳定,能用 301 就不要用临时跳轉。
- 舊域名上還有可訪問的獨立内容时,要先判断這些内容是否還需要保留,而不是一律跳走。
- 清理過程中收錄數量出現波動是正常現象,不必因為一两天的變化就临时改方案。
域名层的動作和頁面层的動作生效节奏不同,索引更新通常滞後。建议按周观察日誌和索引資料,而不是每天盯着數字調整策略。