同一篇稿子,可能在自有站点、授权转载方、聚合平台,甚至几个镜像域名上同时存在。结果就是搜索结果里冒出好几个入口,用户点进去看到的正文几乎一样。这是做收录时很常见的一种“分散”。要处理它,先得理解搜索引擎在几个版本之间更倾向保留哪一版。
判断主版本时,通常会参考哪些信号
没有公开的固定权重,但下面几类信息在多数情况下都会被用到:
- 首次出现的时间:同一段内容,先被发现的那一版往往更容易被当作原始出处。
- 指向它的链接:外部链接、站内推荐、转载时保留的来源链接,都算一种投票。
- URL 与站点的稳定性:协议、主机名、路径写法统一,可正常抓取的站点,判断成本更低。
- 内容完整度:正文齐全、有作者和发布时间、配图可访问的那一版,通常比残缺副本更占优。
- 站点整体质量:如果同一站点里低价值页面占比很高,它的版本被保留的概率也会受影响。
这些信号是综合看的,所以“谁先发谁一定赢”并不成立,只能在方向上争取,而不是精确控制。
站点能主动做的收敛动作
与其等搜索引擎去猜,不如先把明显的重复路口收掉。
授权转载
- 原作者与转载方约定时间差,转载方延后发布,避免同一时刻两处齐发。
- 转载页在 head 里用 canonical 指向原文 URL,前提是两边地址都长期稳定。
- 正文保留来源与原文链接,转载方不要把这行删掉。
- 同一篇稿子不要在转载方站内再衍生出多个可索引版本,例如分享用的带参数链接。
站内的副本
- 聚合页、标签页、打印页这类系统生成的副本,判断价值不高时可以让它们不进索引。
- 分页内容尽量不要把每一页都当成一篇独立文章来处理。
- 同一份内容不要同时挂在子域名和主域名两套路径下,否则等于自己和自己竞争。
发出信号之后,看什么数据
收敛动作做完并不等于立刻生效,重复内容的判定会随着新一轮抓取重新评估,观察几周比较现实。
- 用标题片段或站内搜索查,看结果里保留的是哪个域名、哪个 URL。
- 看抓取日志,副本站点的蜘蛛来访频次是否在下降。
- 看自己站点的索引状态,目标 URL 有没有被替换成别的版本。
- 看这部分页面的点击入口是否集中到了主版本上。
重复内容处理的目标不是“只剩一个 URL 才叫干净”,而是让用户和搜索引擎都能明确知道,哪一版是长期维护的主版本。
容易走偏的几个做法
- 直接屏蔽所有转载方的抓取,短期看似干净,却也丢掉了外部链接和曝光机会。
- 把 canonical 随便指向一个内容不相干的页面,这种信号通常会被忽略。
- 自家多个域名互相 canonical,形成循环,等于没有指定。
- 只有主站做了规范,转载方照旧各自生成副本,收敛效果会打折扣。
把这几个环节理顺之后,同一篇内容的多个入口会慢慢收拢,剩下的工作就是定期抽查:主版本是否还稳定可抓取,副本站的重复是否又长出来了。