網站收錄

主站、子域與备用域混着統計:站群收錄量要先按域名拆開

站群或多域名站点常把所有域名的收錄量加總来看,但收錄是按 URL 判定的,不同域名下的頁面在索引里各自獨立。把主站、子域、备用域的清單拆開,剔除跳轉目标,分別核對已發現、已抓取、已收錄三個數字,才能看清每個域名真實的收錄狀態。

網站收錄

主站、子域與备用域混着統計:站群收錄量要先按域名拆開

做站群或多域名运营的站点,常见一種統計方式:把主站、子域、备用域名的收錄量加在一起,看到一個很大的數字,就認為整体收錄情况不错。但收錄是按 URL 判定的,不同域名下的頁面在索引里是各自獨立的個体,加總之後的數字既不能說明哪個域名健康,也不能說明内容覆盖得怎么样。

為什么收錄量要按域名拆開看

至少有三個原因。

  • 收錄归属不同。同一個頁面的主域版本和子域版本,如果都能訪問,搜尋引擎可能各收錄一份,也可能只保留一份。加總統計时,你無法知道留下的是哪一個。
  • 相似内容互相稀释。不同域名放着高度相似的内容,容易出現只保留一個版本的情况,另一個域名下的頁面即使被抓取,也不一定進索引。
  • 跨域規范化關系更复杂。跨域 canonical、跨域 301 都要額外確認,出错时往往表現為“某個域名收錄量一直上不去”,而只看總量是看不出来的。

拆分之前先確認三件事

  • 每個域名是否有獨立可訪問、且值得獨立存在的内容;
  • 域名之間是否存在 canonical 指向或跳轉關系,方向是否明确;
  • 各域名是否已经分別接入站長平台,能看到各自的索引與抓取資料。

按域名核對的顺序

  1. 分別導出每個域名的 URL 清單,来源包括 sitemap、服務器日誌中蜘蛛命中的 URL、站長平台的索引报告。
  2. 把跳轉目标從源域名清單里剔掉:一個 301 到主域的舊域名頁面,不應该算作该域名的有效收錄。
  3. 按域名分组統計“已發現、已抓取、已收錄”三個數字,而不是只看最後一個。
  4. 確認每個内容簇的主版本 URL,把其余域名下的對應頁面标记為镜像或收敛對象。

几個容易踩的誤判

  • 把跳轉後的落地頁算進源域名。舊域名收錄量看起来還在,其實索引里已经是主域的 URL。
  • 把跨域 canonical 当成已收錄。canonical 只是建议,目标頁没被收錄时,被指向的源頁面同样可能進不了索引。
  • 各域名用同一套内容却各自單獨優化。内容相似度很高,收敛方向又不明确,容易出現几個域名都不稳定的情况。
  • 只看總量看趋势。總量上涨可能只是一個域名在涨、另一個在掉,两者互相抵消。

處理原則

先定主版本,再谈收錄。主版本确定後,其他域名下的同類頁面要么 301 過去,要么用 canonical 明确指向,不要同时保留多份可獨立訪問的相似内容。子域如果承载獨立业務,例如不同产品线、不同地区,應把它当作獨立站点来看待收錄,给獨立的内容和獨立的入口,而不是主站内容的複製。

收錄量是一個按 URL 統計的指标,統計口径不统一时,數字越大越容易誤導判断。

下次做收錄核對时,先花十分钟把域名拆開,看看每個域名各自處在什么狀態,再决定要不要合並看總量。