很多人把“重复内容”理解成两篇一模一样的東西。實际在搜尋索引里,更常见的是近似重复:模板相同、正文主体高度相似,只差标题、價格、地区或几行描述。這類頁面被抓取的概率不低,但往往只有一部分進入索引,剩下的會被归並或按低價值處理。
重复的三種類型,處理方式不一样
- 完全副本:同一篇内容出現在多個 URL 上,比如 http 與 https、带不带 www、參數版和干净版。這属于 URL 規范化問题,收敛成本最低。
- 近似重复:同一套模板下批量生成的頁面,正文主体有七八成重合。常见于聚合頁、地区頁、SKU 變体、标簽頁。
- 意图重复:頁面文字不同,但解决的是同一個搜尋需求。這類不靠技術手段解决,靠内容取舍。
需要区分“重复”和“相似”。搜尋引擎做的是聚類和選主版本,偶尔出現同一组里两個頁面都進索引,或者主版本換人,都属于正常波動。判断是否要動手,看的是這一组頁面是否長期占用了本可以留给其他頁面的抓取與索引位置。
判定信号:几條低成本自查
- 去掉導航、頁脚、侧栏之後,正文主体還剩多少獨有段落;
- 两個頁面的首段结构和 h2 层級是否几乎一致;
- 差异是否只落在几個可變量上,比如價格、城市、型号、年份;
- 标题标簽除變量外是否完全相同;
- 内鏈是否只指向自己那一版,從不互相引用。
一個简單办法:随机抽二十组相似 URL,把正文複製成纯文本對比。如果差异字數不到全文的两成,基本可以按近似重复處理。另一個信号来自服務器日誌——同一组頁面被反复抓取,但索引狀態报告里始终只有一两個,說明抓取端已经把它們当成一件事。
處理顺序:先定主版本,再谈收敛
- 确定业務主版本。看三件事:哪一版有自然外鏈和入口、哪一版轉化更好、哪一版内容最完整。別預設“先發布的”就是主版本。
- 確認主版本本身可抓可索引。检查 robots、noindex、canonical 是否自指、服務器是否稳定返回 200。主版本自己出問题,後面的收敛都白做。
- 用 canonical 把變体指過去,而不是用 noindex 一刀切。canonical 是提示而非指令,搜尋引擎仍會自行判断,但它能明顯减少歧义。
- 近似重复頁考虑合並或差异化。合並是把内容並到一個 URL 再 301;差异化是补上獨有信息,让它值得單獨存在。二選一,別两件都不做。
- 检查入口和内鏈。被收敛的頁面如果還在導航、面包屑、相關推荐里大量出現,抓取端會持續訪問,收敛效果會被稀释。
- 观察一到两個抓取周期再調整。重复判定和索引更新都有延迟,频繁改動只會增加噪音。
不要用 canonical 掩盖内容問题
有些頁面之間不是“谁抄谁”,而是两篇都寫得太薄。這时加 canonical 只是把問题藏起来:索引里少了几個薄頁面,用戶的需求仍然没被满足。该做的是把内容做厚,或者干脆合並成一頁。
几個常见坑
- 给所有變体都加 noindex,结果主版本被顺带屏蔽;
- canonical 指向一個 404 或並不存在的 URL;
- 用 301 把带流量的舊頁面统一跳到首頁,等于放弃原有的相關性;
- 把“被抓取”直接当成“被收錄”,重复頁面在日誌里刷得很勤,索引里却一個都没有。
重复内容處理的目标不是让頁面數量變少,而是让每一组相似頁里,留下一個最值得被索引的版本。
收尾时做一張表:主版本 URL、變体 URL、目前狀態(可索引或已排除)、處理動作、复查日期。比反复猜搜尋引擎怎么想要有效得多。