同一段内容出现在多个地址上,本身不会立刻带来惩罚,但它会让搜索引擎在挑选“该展示哪一个”时多花时间,也会分散本该集中在一个页面上的信号。真正麻烦的不是重复本身,而是重复得没有主次、没有明确指向。
把重复内容一概当成“要删掉的东西”往往适得其反。更实用的做法是先分清重复的程度,再决定用哪种手段。
重复的三种程度
- 完全重复:正文逐字相同,只有域名、导航或页脚不同。常见于整站镜像、采集站以及同一套内容部署在多个域名上的情况。
- 近似重复:主体信息相同但表述有差异,例如同一产品的不同城市落地页、同主题的不同筛选项、同一新闻被转载后只加了几句导语。
- 模板重复:内容由模板批量生成,正文的有效信息很少,比如空结果页、只有一两条信息的标签页、把标题换个词就生成的聚合页。
这三类的处理思路完全不同:第一类要解决归属,第二类要解决差异化或合并,第三类要解决是否值得被收录。
判断是否重复,先看几个位置
- 标题、H1 与首段是否几乎一致;
- 正文有效段落的重合比例,而不是整页 HTML 的相似度;
- 页面各自是否还有独立信息,比如价格、库存、地区、时间;
- 用户从这两个地址进入,得到的结果是否实质相同。
第 4 点最容易被忽略。机器算出来的相似度和人实际感受到的价值经常不一致,而后者更接近判断标准。
处理顺序
完全重复:先确定主副本
选一个地址作为主副本,其余用 301 指向它。选择依据通常是内容最新最全、外链与访问量最多、URL 最稳定。跨域名的镜像如果不能做 301,至少在副本页上用 canonical 指向主副本,并确认副本页没有被 robots.txt 拦住——被拦住时,canonical 往往不会被读到。
近似重复:优先合并或差异化
如果两个页面的差异只是措辞,合并成一页通常比硬造两页更划算。确实需要分开的,例如不同城市的服务页,就让每页都有本地化的实质内容:地址、联系方式、案例、可预约时间。仅有城市名替换的页面,很容易被归到模板重复那一类。
模板重复:先问值不值得收录
分页、标签、筛选结果这类页面,很多是给用户用的,不一定要进索引。可以用 noindex 保留其导航作用,也可以保留收录但确保列表里有足够的独特条目。判断标准很简单:这个页面被单独搜到时,能提供什么别处没有的信息?答不上来,就不必强求收录。
重复内容处理的目标不是“消灭重复”,而是让每个保留下来的地址都有明确的角色。
几个容易踩的坑
- 只改标题和首段就当成新页面,正文主体不变;
- canonical 和 noindex 同时用在同一页上,信号互相抵消;
- 全站一刀切把 canonical 指向首页,把本可以独立收录的页面也并掉了;
- 清理旧地址时直接返回 404,而没有保留跳转;
- 屏蔽与删除同时做,导致后续无法观察效果。
处理完之后看什么
改动生效需要时间,不要用单日的收录数字下结论。可以观察目标地址的抓取频次是否上升、canonical 是否被采用、重复地址是否逐渐从索引中退出、主副本的展现与点击是否集中。若两三周后重复地址仍大量留在索引里,再检查一次跳转链路和 canonical 的可读性。
重复内容的处理更像整理房间:先分清哪些是主件、哪些是副本、哪些只是常用的便签,再决定摆放方式。顺序对了,后面的收录判断会简单很多。