做站群或多域名运营的站点,常见一种统计方式:把主站、子域、备用域名的收录量加在一起,看到一个很大的数字,就认为整体收录情况不错。但收录是按 URL 判定的,不同域名下的页面在索引里是各自独立的个体,加总之后的数字既不能说明哪个域名健康,也不能说明内容覆盖得怎么样。
为什么收录量要按域名拆开看
至少有三个原因。
- 收录归属不同。同一个页面的主域版本和子域版本,如果都能访问,搜索引擎可能各收录一份,也可能只保留一份。加总统计时,你无法知道留下的是哪一个。
- 相似内容互相稀释。不同域名放着高度相似的内容,容易出现只保留一个版本的情况,另一个域名下的页面即使被抓取,也不一定进索引。
- 跨域规范化关系更复杂。跨域 canonical、跨域 301 都要额外确认,出错时往往表现为“某个域名收录量一直上不去”,而只看总量是看不出来的。
拆分之前先确认三件事
- 每个域名是否有独立可访问、且值得独立存在的内容;
- 域名之间是否存在 canonical 指向或跳转关系,方向是否明确;
- 各域名是否已经分别接入站长平台,能看到各自的索引与抓取数据。
按域名核对的顺序
- 分别导出每个域名的 URL 清单,来源包括 sitemap、服务器日志中蜘蛛命中的 URL、站长平台的索引报告。
- 把跳转目标从源域名清单里剔掉:一个 301 到主域的旧域名页面,不应该算作该域名的有效收录。
- 按域名分组统计“已发现、已抓取、已收录”三个数字,而不是只看最后一个。
- 确认每个内容簇的主版本 URL,把其余域名下的对应页面标记为镜像或收敛对象。
几个容易踩的误判
- 把跳转后的落地页算进源域名。旧域名收录量看起来还在,其实索引里已经是主域的 URL。
- 把跨域 canonical 当成已收录。canonical 只是建议,目标页没被收录时,被指向的源页面同样可能进不了索引。
- 各域名用同一套内容却各自单独优化。内容相似度很高,收敛方向又不明确,容易出现几个域名都不稳定的情况。
- 只看总量看趋势。总量上涨可能只是一个域名在涨、另一个在掉,两者互相抵消。
处理原则
先定主版本,再谈收录。主版本确定后,其他域名下的同类页面要么 301 过去,要么用 canonical 明确指向,不要同时保留多份可独立访问的相似内容。子域如果承载独立业务,例如不同产品线、不同地区,应把它当作独立站点来看待收录,给独立的内容和独立的入口,而不是主站内容的复制。
收录量是一个按 URL 统计的指标,统计口径不统一时,数字越大越容易误导判断。
下次做收录核对时,先花十分钟把域名拆开,看看每个域名各自处在什么状态,再决定要不要合并看总量。