網站收錄

重复内容分三種程度:主副本、近副本與模板重复的處理顺序

重复内容不等于必须刪除。把重复拆成完全重复、近似重复和模板重复三種程度,分別對應确定主副本、合並或差异化、判断是否值得收錄三種處理方式。本文给出判断顺序、常见誤区和處理之後该观察哪些指标,帮助站点把有限的抓取與索引资源集中到真正有價值的地址上。

網站收錄

重复内容分三種程度:主副本、近副本與模板重复的處理顺序

同一段内容出現在多個地址上,本身不會立刻带来惩罚,但它會让搜尋引擎在挑選“该展示哪一個”时多花時間,也會分散本该集中在一個頁面上的信号。真正麻烦的不是重复本身,而是重复得没有主次、没有明确指向。

把重复内容一概当成“要删掉的東西”往往适得其反。更實用的做法是先分清重复的程度,再决定用哪種手段。

重复的三種程度

  • 完全重复:正文逐字相同,只有域名、導航或頁脚不同。常见于整站镜像、采集站以及同一套内容部署在多個域名上的情况。
  • 近似重复:主体信息相同但表述有差异,例如同一产品的不同城市落地頁、同主题的不同篩選項、同一新闻被轉载後只加了几句導语。
  • 模板重复:内容由模板批量生成,正文的有效信息很少,比如空结果頁、只有一两條信息的标簽頁、把标题換個词就生成的聚合頁。

這三類的處理思路完全不同:第一類要解决归属,第二類要解决差异化或合並,第三類要解决是否值得被收錄。

判断是否重复,先看几個位置

  1. 标题、H1 與首段是否几乎一致;
  2. 正文有效段落的重合比例,而不是整頁 HTML 的相似度;
  3. 頁面各自是否還有獨立信息,比如價格、库存、地区、時間;
  4. 用戶從這两個地址進入,得到的结果是否實质相同。

第 4 点最容易被忽略。机器算出来的相似度和人實际感受到的價值经常不一致,而後者更接近判断标准。

處理顺序

完全重复:先确定主副本

選一個地址作為主副本,其余用 301 指向它。選擇依據通常是内容最新最全、外鏈與訪問量最多、URL 最稳定。跨域名的镜像如果不能做 301,至少在副本頁上用 canonical 指向主副本,並確認副本頁没有被 robots.txt 拦住——被拦住时,canonical 往往不會被讀到。

近似重复:優先合並或差异化

如果两個頁面的差异只是措辞,合並成一頁通常比硬造两頁更划算。确實需要分開的,例如不同城市的服務頁,就让每頁都有本地化的實质内容:地址、联系方式、案例、可预约時間。僅有城市名替換的頁面,很容易被归到模板重复那一類。

模板重复:先問值不值得收錄

分頁、标簽、篩選结果這類頁面,很多是给用戶用的,不一定要進索引。可以用 noindex 保留其導航作用,也可以保留收錄但确保列表里有足够的獨特條目。判断标准很简單:這個頁面被單獨搜到时,能提供什么別處没有的信息?答不上来,就不必强求收錄。

重复内容處理的目标不是“消灭重复”,而是让每個保留下来的地址都有明确的角色。

几個容易踩的坑

  • 只改标题和首段就当成新頁面,正文主体不變;
  • canonical 和 noindex 同时用在同一頁上,信号互相抵消;
  • 全站一刀切把 canonical 指向首頁,把本可以獨立收錄的頁面也並掉了;
  • 清理舊地址时直接返回 404,而没有保留跳轉;
  • 屏蔽與刪除同时做,導致後續無法观察效果。

處理完之後看什么

改動生效需要時間,不要用單日的收錄數字下结论。可以观察目标地址的抓取频次是否上升、canonical 是否被采用、重复地址是否逐渐從索引中登出、主副本的展現與点击是否集中。若两三周後重复地址仍大量留在索引里,再检查一次跳轉鏈路和 canonical 的可讀性。

重复内容的處理更像整理房間:先分清哪些是主件、哪些是副本、哪些只是常用的便簽,再决定摆放方式。顺序對了,後面的收錄判断會简單很多。