網站收錄

重复内容分三层:完全重复、近似重复與模板重复的處理差別

站内重复内容並不是一種問题,而是三层:完全相同的副本、改寫或拼接出的近似版本、以及模板批量生成的相似頁面。先判断属于哪一层,再决定是统一地址、合並内容還是收口索引,顺序搞错往往白費力气。

網站收錄

重复内容分三层:完全重复、近似重复與模板重复的處理差別

發現站内出現重复内容时,很多人的第一反應是加 canonical 或者直接 noindex。但在動手之前,先判断重复發生在哪一层更重要——不同层級的重复,成因和處理顺序完全不同,用错手段常常是白費力气,甚至把原本正常的頁面挡在索引之外。

第一层:完全重复,同一份内容挂在多個 URL 上

特征是整段正文、标题、结构几乎一字不差,只是訪問地址不同。常见来源有:

  • 同一頁面同时能被 www 與非 www、http 與 https 打開;
  • 带與不带结尾斜杠、大小寫不同被当成不同地址;
  • 列表頁通過參數翻頁或排序,生成了内容几乎一致的副本;
  • 站内複製粘贴做測試,忘了刪除或没做跳轉。

這一层的處理最干净:先统一地址,再谈索引。能 301 的就 301,让所有變体指向唯一的規范地址;确實無法跳轉(比如追踪參數必须保留)时,用 canonical 声明主版本。注意 canonical 是建议而不是命令,只有在頁面本身可正常訪問、且主版本也真實存在的前提下才有意义。

第二层:近似重复,内容被改寫或拼接

這一层藏得比較深。正文可能換了開头结尾、調了段落顺序、替換了部分同义词,但主体信息高度重合。常见来源:同一篇稿件在不同栏目各發一次;产品頁的規格段落大量共用;聚合頁把摘要拼在一起,跟原文形成竞争。

判断方法不是靠工具跑一次相似度就够了,而是要看用戶搜尋這個問题时,期望看到哪一個頁面。如果两個頁面满足的是同一個搜尋意图,就應该合並成一個;如果满足的意图不同(例如一個是产品介绍,一個是選购指南),保留两個反而合理,此时要做的是把各自的差异部分寫清楚,而不是硬塞 canonical。

合並时優先做的事

  1. 選一個主版本,把其余版本里真正有價值的信息补進去;
  2. 舊地址做 301 跳轉到主版本,不要只是删掉;
  3. 更新站内連結,让後續抓取路径直接指向主版本;
  4. 观察一段時間,確認索引里的版本逐步替換。

第三层:模板重复,批量生成的相似頁面

這類頁面單看每一頁都不算抄,但几十上百頁放在一起,除了名稱、價格、地区等少數變量外几乎没有区別。常见的有:篩選组合頁、空结果的标簽頁、只有一條内容的作者頁、按時間自動生成的归档頁。

處理原則是先問一句:這一頁有没有獨立被搜尋的價值

  • 有明确搜尋需求的篩選组合(比如品牌加品類),可以保留,但要保證有足够的结果數量,並让搜尋引擎抓到稳定入口;
  • 结果很少甚至為空的组合,通常不必要被索引,可以在服務端返回合适狀態,或用 robots 規則收敛;
  • 纯粹给用戶做導航用的列表,用 noindex,follow 保留連結传递,比彻底屏蔽更合适。

處理顺序:先規范地址,再判断意图,最後决定取舍

把三层叠在一起處理,最容易出的错是:一邊加 canonical,一邊又让參數頁大量被抓,结果索引里的版本反复横跳。比較稳妥的顺序是:

  1. 先做 URL 层净化——统一协议、域名、尾斜杠、大小寫,消除纯技術性重复;
  2. 再按搜尋意图分组,判断近似重复该合並還是该保留差异;
  3. 最後處理模板頁,决定哪些進索引、哪些只留連結;
  4. 每一步都留出观察周期,不要同一天改三件事,否則出問题时分不清是谁引起的。
重复内容本身不是惩罚項,它的問题是让搜尋引擎难以判断该展示哪一個版本,從而稀释了頁面的表現。處理的终点不是消灭重复,而是让每個有價值的搜尋意图都對應一個清晰的頁面。

最後提醒一点:不要指望改完立刻看到索引變化。索引更新是渐進的,與其每天刷新报告,不如把注意力放在内鏈是否都指向了主版本、舊地址是否還會被外部引用這些更容易控制的事情上。