同一段内容出現在多個地址上,本身不會立刻带来惩罚,但它會让搜尋引擎在挑選“该展示哪一個”时多花時間,也會分散本该集中在一個頁面上的信号。真正麻烦的不是重复本身,而是重复得没有主次、没有明确指向。
把重复内容一概当成“要删掉的東西”往往适得其反。更實用的做法是先分清重复的程度,再决定用哪種手段。
重复的三種程度
- 完全重复:正文逐字相同,只有域名、導航或頁脚不同。常见于整站镜像、采集站以及同一套内容部署在多個域名上的情况。
- 近似重复:主体信息相同但表述有差异,例如同一产品的不同城市落地頁、同主题的不同篩選項、同一新闻被轉载後只加了几句導语。
- 模板重复:内容由模板批量生成,正文的有效信息很少,比如空结果頁、只有一两條信息的标簽頁、把标题換個词就生成的聚合頁。
這三類的處理思路完全不同:第一類要解决归属,第二類要解决差异化或合並,第三類要解决是否值得被收錄。
判断是否重复,先看几個位置
- 标题、H1 與首段是否几乎一致;
- 正文有效段落的重合比例,而不是整頁 HTML 的相似度;
- 頁面各自是否還有獨立信息,比如價格、库存、地区、時間;
- 用戶從這两個地址進入,得到的结果是否實质相同。
第 4 点最容易被忽略。机器算出来的相似度和人實际感受到的價值经常不一致,而後者更接近判断标准。
處理顺序
完全重复:先确定主副本
選一個地址作為主副本,其余用 301 指向它。選擇依據通常是内容最新最全、外鏈與訪問量最多、URL 最稳定。跨域名的镜像如果不能做 301,至少在副本頁上用 canonical 指向主副本,並確認副本頁没有被 robots.txt 拦住——被拦住时,canonical 往往不會被讀到。
近似重复:優先合並或差异化
如果两個頁面的差异只是措辞,合並成一頁通常比硬造两頁更划算。确實需要分開的,例如不同城市的服務頁,就让每頁都有本地化的實质内容:地址、联系方式、案例、可预约時間。僅有城市名替換的頁面,很容易被归到模板重复那一類。
模板重复:先問值不值得收錄
分頁、标簽、篩選结果這類頁面,很多是给用戶用的,不一定要進索引。可以用 noindex 保留其導航作用,也可以保留收錄但确保列表里有足够的獨特條目。判断标准很简單:這個頁面被單獨搜到时,能提供什么別處没有的信息?答不上来,就不必强求收錄。
重复内容處理的目标不是“消灭重复”,而是让每個保留下来的地址都有明确的角色。
几個容易踩的坑
- 只改标题和首段就当成新頁面,正文主体不變;
- canonical 和 noindex 同时用在同一頁上,信号互相抵消;
- 全站一刀切把 canonical 指向首頁,把本可以獨立收錄的頁面也並掉了;
- 清理舊地址时直接返回 404,而没有保留跳轉;
- 屏蔽與刪除同时做,導致後續無法观察效果。
處理完之後看什么
改動生效需要時間,不要用單日的收錄數字下结论。可以观察目标地址的抓取频次是否上升、canonical 是否被采用、重复地址是否逐渐從索引中登出、主副本的展現與点击是否集中。若两三周後重复地址仍大量留在索引里,再检查一次跳轉鏈路和 canonical 的可讀性。
重复内容的處理更像整理房間:先分清哪些是主件、哪些是副本、哪些只是常用的便簽,再决定摆放方式。顺序對了,後面的收錄判断會简單很多。