提到重复内容,多數站点第一反應是“別人抄了我的文章”。但在收錄层面,更常见的情况是自己站内生成了一批高度相似的頁面,彼此争夺同一個索引位置。這類頁面往往不是抄来的,而是模板、參數和分頁在批量生成时自然留下的产物。
一、模板批量生成的近似頁面
列表頁、标簽頁、篩選结果頁通常共用同一套模板,正文区域只有几條連結,标题由變量拼出来。当篩選條件组合過多时,會生成大量内容差异极小的URL。搜尋引擎抓取這些頁面本身没問题,但在判断“這個URL代表什么内容”时會遇到困难。
判断方法很简單:把两個頁面的正文去掉導航和頁脚後放在一起看,如果剩下的實质内容差异不足两三成,它們大概率属于同一類近似頁面。
二、參數制造的近似URL
排序參數、追踪參數、會话ID、每頁條數,都會让同一份内容對應多條URL。常见形式包括:
- 排序與视图參數:sort=price、view=list,内容相同只是顺序不同;
- 追踪參數:utm_、from=、ref= 等,多用于統計,對内容没有影响;
- 會话與篩選參數:sid=、filter=,容易随用戶操作無限扩展。
處理时先確認哪一條是規范版本,再通過 canonical、robots 或站内連結控制其余版本的抓取與索引,避免同一份内容被拆成多份。
三、分頁與聚合頁的重叠
分頁序列、按時間归档、按分類聚合,這三類頁面经常互相重叠。第2頁的内容可能和某個标簽頁高度一致,聚合頁又可能和詳情頁共享大段摘要。搜尋引擎需要判断哪一版是“完整内容”的代表,如果站点自己不表態,就容易出現版本反复替換。
站点可以做的整理
- 先列出所有會批量生成URL的模板,标注用途;
- 区分“给用戶看的”和“给抓取用的”,後者不必全部開放索引;
- 為每類頁面指定唯一的規范版本,並在站内連結中统一指向它;
- 观察抓取與索引狀態,確認調整後是否按预期收敛。
整理重复内容的目的不是追求“頁面越少越好”,而是让每個值得被索引的URL都有清晰的代表身份。
四、整理之後要观察什么
調整完成後,不要只看抓取量。更值得關注的是索引狀態是否稳定、規范版本是否被選中、近似頁面是否逐步登出索引。如果一段時間後狀態没有變化,回头检查站内連結是否還在指向舊版本,或者站点地图里是否仍保留了大量近似URL。
重复内容的處理往往不是一次性的,新模板、新篩選條件上线後都可能重新引入問题。把上面這套检查做成固定動作,比事後集中清理更省力。