發現索引里出現一批内容差不多的頁面时,很多人的第一反應是加 canonical 或者直接 noindex。但重复内容的成因差別很大,處理手段也不一样。先分清問题属于哪一類,再動手,能少走不少弯路。
先分清两類問题
第一類是同一個頁面被多個 URL 指代:带不带 www、结尾有没有斜杠、大小寫、參數、會话 ID 等,用戶看到的内容基本一致,只是地址不同。第二類是多篇内容相似的頁面:列表頁、标簽頁、聚合頁與正文頁之間主题重叠,或者同一篇文章被拆成几個版本。前者靠 URL 規范收敛,後者往往要從頁面定位和内容策略上解决,混在一起處理容易越改越乱。
第一步:確認内容是否真的重复
不要只看标题像不像。抽样打開几個頁面,比對正文主体、字段信息和区块结构。常见情况是:标题相似但正文完全不同,這属于模板重复而非内容重复;或者正文一致、周邊推荐和评论數量不同,這属于同一内容的不同外壳。判断清楚之後,再决定是保留一個主版本,還是让它們各自獨立存在。
第二步:看 URL 层能收敛掉什么
- 协议、主机名、www 與非 www:只保留一個,其余 301 過去。
- 尾斜杠與大小寫:在服務器层统一,不要指望搜尋引擎自己判断。
- 篩選、排序、追踪參數:能收敛的收敛,能改成锚点或表單提交的更好。
- 分頁參數:内容连續的分頁保留,纯排序视图尽量收敛到主列表。
URL 层的問题處理起来最干脆,也最容易驗證,建议放在最前面做。
第三步:检查頁面内的信号是否自相矛盾
URL 收敛之後,頁面内部還要给出一致的方向:canonical 指向的地址要和内鏈、sitemap、面包屑指向的地址相同;分頁之間用 rel 标注清楚;同一篇内容的不同語言或地区版本,用對應标簽互相說明。任何一個环节指错方向,都會让蜘蛛在两套地址之間来回摇摆。
第四步:聚合頁和标簽頁要不要放手
聚合頁和标簽頁本身有導航價值,但它們经常和正文頁争夺同一批關鍵詞。判断标准可以看两点:這個頁面有没有獨立的編輯内容,例如導语、排序逻辑、人工篩選的條目;以及用戶從搜尋進来後能不能直接获得答案。前者有、後者能,就让它正常參與收錄;只是為了填满栏目而自動拼装的,可以考虑收敛,或者保留在站内但不作為主要入口。
處理顺序與观察节奏
- 先解决 URL 层的重复,確認主版本唯一。
- 再统一站内連結、sitemap 與 canonical 的方向。
- 然後處理内容层面的重复,决定合並、改寫還是收敛。
- 最後看抓取日誌和索引狀態的變化,给两到四周的观察期。
重复内容處理不是一次性動作。站点结构、商品上下架、运营活動都會不断产生新地址,把它当成常規巡检的一部分,比一次性大清理更省力。
如果調整之後索引里的重复地址没有立刻减少,不必急着反复修改。重新抓取和替換索引需要時間,频繁改動反而會让信号變得不稳定。先確認目前設定是對的,再观察變化。