做站群或多域名运营的站点,常见一種統計方式:把主站、子域、备用域名的收錄量加在一起,看到一個很大的數字,就認為整体收錄情况不错。但收錄是按 URL 判定的,不同域名下的頁面在索引里是各自獨立的個体,加總之後的數字既不能說明哪個域名健康,也不能說明内容覆盖得怎么样。
為什么收錄量要按域名拆開看
至少有三個原因。
- 收錄归属不同。同一個頁面的主域版本和子域版本,如果都能訪問,搜尋引擎可能各收錄一份,也可能只保留一份。加總統計时,你無法知道留下的是哪一個。
- 相似内容互相稀释。不同域名放着高度相似的内容,容易出現只保留一個版本的情况,另一個域名下的頁面即使被抓取,也不一定進索引。
- 跨域規范化關系更复杂。跨域 canonical、跨域 301 都要額外確認,出错时往往表現為“某個域名收錄量一直上不去”,而只看總量是看不出来的。
拆分之前先確認三件事
- 每個域名是否有獨立可訪問、且值得獨立存在的内容;
- 域名之間是否存在 canonical 指向或跳轉關系,方向是否明确;
- 各域名是否已经分別接入站長平台,能看到各自的索引與抓取資料。
按域名核對的顺序
- 分別導出每個域名的 URL 清單,来源包括 sitemap、服務器日誌中蜘蛛命中的 URL、站長平台的索引报告。
- 把跳轉目标從源域名清單里剔掉:一個 301 到主域的舊域名頁面,不應该算作该域名的有效收錄。
- 按域名分组統計“已發現、已抓取、已收錄”三個數字,而不是只看最後一個。
- 確認每個内容簇的主版本 URL,把其余域名下的對應頁面标记為镜像或收敛對象。
几個容易踩的誤判
- 把跳轉後的落地頁算進源域名。舊域名收錄量看起来還在,其實索引里已经是主域的 URL。
- 把跨域 canonical 当成已收錄。canonical 只是建议,目标頁没被收錄时,被指向的源頁面同样可能進不了索引。
- 各域名用同一套内容却各自單獨優化。内容相似度很高,收敛方向又不明确,容易出現几個域名都不稳定的情况。
- 只看總量看趋势。總量上涨可能只是一個域名在涨、另一個在掉,两者互相抵消。
處理原則
先定主版本,再谈收錄。主版本确定後,其他域名下的同類頁面要么 301 過去,要么用 canonical 明确指向,不要同时保留多份可獨立訪問的相似内容。子域如果承载獨立业務,例如不同产品线、不同地区,應把它当作獨立站点来看待收錄,给獨立的内容和獨立的入口,而不是主站内容的複製。
收錄量是一個按 URL 統計的指标,統計口径不统一时,數字越大越容易誤導判断。
下次做收錄核對时,先花十分钟把域名拆開,看看每個域名各自處在什么狀態,再决定要不要合並看總量。