做收錄检查时,重复内容是最常被提起的一類問题。但“重复”本身包含好几種情况,混在一起處理,容易把正常頁面改坏,也未必能解决收錄問题。先把重复類型分清,再决定是合並、規范還是保留。
一、先分清三種重复
站点里的重复通常来自三個层面:
- 模板重复:多個頁面共用同一套标题、摘要或正文区块,主内容却很少。比如商品篩選頁、空结果列表頁。
- 參數重复:同一個頁面因為追踪參數、排序參數、會话參數产生多個URL,指向基本相同的内容。
- 正文重复:不同URL下确實是同一篇文章、同一件商品,或大量轉载内容。
三種重复的處理方式不一样。模板重复更多是頁面质量問题,參數重复属于URL規范問题,正文重复才接近通常说的“複製内容”。
二、模板重复:先看頁面有没有獨立價值
模板重复不一定都要删。一個分類列表頁如果确實帮用戶找到内容,也有獨立價值,可以保留;但如果只是把相同商品換個排序、換個篩選條件,正文几乎不變,索引里就容易出現多個相似頁面。
處理时可以先問:這個頁面离開模板之後,還剩下多少獨有内容?如果只剩几行字加連結,可以考虑:
- 把低價值篩選组合设為 noindex,或让它僅用于用戶導航;
- 保留有搜尋量的主要篩選组合,补上說明性内容;
- 检查分頁、排序參數是否产生了大量入口,避免它們和主列表頁争抢同一個主题。
模板重复的核心不是“頁面長得像”,而是“頁面之間有没有可区分的用途”。
三、參數重复:優先做URL收敛
參數URL常见的麻烦是同一内容有多個地址。比如追踪參數、排序參數、會话ID、展示方式參數。搜尋引擎可能只選一個版本,也可能把抓取预算分给多個入口。
可以按這個顺序處理:
- 列出參數類型,区分“改變内容”和“不改變内容”;
- 不改變内容的參數,尽量用 canonical 指向無參數版本;
- 确實需要保留的參數頁面,确保标题、描述和頁面主体有對應差异;
- 站内連結尽量只指向規范版本,不要多個版本混用。
這里要注意,canonical 是提示,不是强制指令。如果頁面之間内容差异明顯,或者内鏈長期指向另一個版本,搜尋引擎未必按你期望的版本收錄。
四、正文重复:判断是本身重复還是被轉载
正文重复要分两種情况。一種是站内自己重复,比如同一篇文章挂在多個栏目下,或者舊版和新版同时存在;另一種是站外轉载,別的站点先發或同步發布。
站内重复相對好办:保留一個主要URL,其余做301或 canonical,更新内鏈。站外轉载則不完全可控,能做的通常是:
- 確認自己的頁面是首發或至少是主要版本;
- 在正文中保留来源、作者、發布時間等可核對信息;
- 不要為了“抢收錄”把同一篇文章反复改标题發布;
- 如果轉载方大量采集,可以通過正規渠道反馈,但不必指望一次處理就全部消失。
五、抓取和收錄要分開看
重复内容多,首先影响的是抓取分配:爬虫可能把時間花在相似URL上。但抓取到了不等于會被收錄。收錄還會看頁面质量、連結關系、用戶需求等。所以排查时不要只看“有没有被抓”,也要看“被抓的版本是不是你希望被索引的版本”。
一個實用的做法是:先按模板和參數分组,每组挑几個代表URL,到索引里查它們實际被收錄的版本;再回头检查站内連結和 canonical 是否指向一致。如果發現同一内容有多個版本被索引,再逐组收敛,而不是一次性全站改動。
六、處理顺序小结
- 先分類:模板、參數、正文三類重复分開记錄;
- 再看價值:頁面是否有獨立用途,能否留下;
- 然後定規范:确定主要URL,统一内鏈和 canonical;
- 最後观察:给一段過渡時間,看索引版本是否慢慢收敛;
- 不要频繁改:同一批URL反复換規范,反而让搜尋引擎难以判断。
重复内容不是一删了之的事。多數情况下,先分清類型,再把URL和連結關系收敛到一個主版本,比大規模删頁面更稳。