发现原创内容还停在“已发现,尚未编入索引”,而一个转载页或聚合页已经出现在搜索结果里,很多人第一反应是“权重不够”。但重复内容问题的核心通常不是权重,而是搜索引擎需要先判断:这两段内容在索引里到底算一份还是两份。判断对象搞错了,后面所有动作都是白费。
先确认是不是真的重复
不是所有“看起来像”的页面都会互相挤压。核对之前,先回答三个问题:
- 正文重合比例有多高?只有导语和结论相似、主体内容不同,一般不会被当成同一份。
- 两边是否都能独立满足搜索意图?如果转载页只截取了片段,它本身价值有限,不太可能长期占据位置。
- 页面类型是否相同?原文是深度说明,聚合页只是列表摘要,两者往往各走各的路径。
只有当正文大面积一致、标题和描述几乎相同时,才需要进入归并核对。
核对顺序:从时间信号到链接信号
- 发布时间与更新时间是否可读。原文的发布信息是写在正文可见位置,还是只藏在结构化数据里?时间信号读不出来,快照时间就容易被当成第一手来源。
- 原文有没有自引用 canonical。不少站点在加 canonical 时漏掉了自引用,导致页面之间的信号互相冲突,搜索引擎只能自己猜。
- 转载页有没有指向原文。如果对方给出了明确来源链接,归并通常会顺畅一些;没有来源链接时,只能靠内容比对。
- 两个 URL 的内部链接量。原文如果要从首页深挖三四层才点得到,而转载页到处被链接,抓取优先级自然不同。
- 入口是否唯一。同一篇内容在站内有三个入口(专题页、标签页、归档页),每个入口都返回 200,等于自己制造了竞争。
顺序不要跳。先看时间信号,再看 canonical,最后才看链接和入口结构。很多人直接从最后一步开始改内链,结果问题还留在前两步。
canonical 不是万能挡板
canonical 表达的是“我建议以哪个 URL 为准”,它是一个提示,不是强制指令。当目标页面本身抓取异常、返回非 200,或者内容与来源页面差异明显时,这个提示会被忽略。所以设置之前,要确认目标 URL 能正常访问、能被抓取、内容确实是同一份。
把 canonical 指向一个自己都进不了索引的页面,等于把信号指向空气。先确认目标可用,再谈归并。
站内重复:先收敛入口
站内重复比跨站转载更好处理,因为你有完整的控制权。常见来源有三类:
- 同一商品挂在多个分类路径下,每条路径都是独立可访问的 URL;
- 标签页、作者页、归档页把同一批文章反复列出;
- 列表分页与筛选参数组合出大量近似页面。
处理思路是保留一条主路径,其余入口要么归并到主路径,要么加条件限制。不要一边让全部入口返回 200,一边指望搜索引擎自己挑出主版本。
几个容易做错的点
- 把投诉下架转载页当成第一选择。多数情况下,先把自己的信号理清楚,效果比投诉更快。
- 为了“抢占”而给原文堆关键词或频繁改标题。内容没变、标题变了,反而让两边的对应关系更模糊。
- 同时用 canonical、robots 和 noindex 去处理同一个 URL。指令叠加会让状态难以判断,先看索引状态,再决定用哪一种。
重复内容的处理目标不是“让转载页消失”,而是让该被收录的那一条 URL 拥有清晰、唯一、可读的信号。把时间、canonical、入口和内部链接按顺序核一遍,多数情况下问题会自己收敛。