内容重复不一定指文字一模一样。只要能通過多個地址訪問到同一批主体内容,或者多個地址的頁面主体高度相似、只有排序或參數不同,就属于需要留意的重复。站点越大,标簽頁、篩選頁、归档頁越多,這類地址就越容易堆积,蜘蛛的抓取額度也容易被它們分散。
常见的重复来源
- 标簽與专题聚合頁:同一篇文章被多個标簽收錄,生成多個只有列表顺序不同的地址。
- 參數頁:排序、篩選、跟踪參數让同一列表出現多種 URL。
- 打印頁與獨立移動版:如果它們各自拥有可訪問地址,又没做規范處理,就容易和主頁面重复。
- 自動归档:按日期、按作者、按分類生成的列表頁,内容往往大量重叠。
- 空頁面:没有内容的标簽、分類、专题,CMS 仍然返回正常狀態碼。
自查方法
- 從服務器日誌里找出被频繁抓取的地址,看它們是否属于同一批内容。
- 用站内爬虫或日誌把返回正常狀態碼的地址與頁面主体做比對,标记高度相似的頁面。
- 检查 canonical:重复頁面是否指向了規范地址,規范地址是否與站点地图、内部連結一致。
- 检查聚合頁的獨特性:如果标簽頁只有标题列表,没有說明、没有篩選價值,就要重新判断它是否值得保留。
- 检查内部連結:導航、标簽云、相關推荐是否把大量入口指向了低價值聚合頁。
- 检查 robots 與 meta robots:是否誤屏蔽了規范頁面,或者放行了不该被抓取的地址。
容易被忽略的细节
- 排序參數不同但内容相同,比如 asc 與 desc 各自對應一個地址。
- 分頁第一頁與不带分頁參數的地址同时存在。
- 大小寫、末尾斜杠、http 與 https 混用造成的多地址。
- 站点地图和内部連結指向了不同版本。
處理思路
處理的目标不是把所有相似頁面删掉,而是让每個保留的地址都有明确用途。
- 合並:把含义相近的标簽合並成一個,舊地址做跳轉。
- 差异化:给聚合頁加一段說明、篩選條件或人工挑選的推荐,让它有獨立價值。
- canonical:對于必须保留但内容高度相似的頁面,用 canonical 指向主版本。
- noindex:對于没有搜尋價值的篩選頁、打印頁,可以只让用戶訪問,不让蜘蛛收錄。
- 内鏈:把主要入口指向規范頁面,减少指向重复地址的連結。
- 站点地图:只提交規范地址,避免把重复頁一並提交。
不要為了省事把所有聚合頁一刀切 noindex。有些专题頁本身有用戶需求,删掉反而损失入口。判断标准是它能不能獨立满足一次訪問。
定期复查
内容重复不是一次性任務。栏目調整、新标簽、新篩選條件都會带来新的重复地址。建议在每次改版、上新栏目、調整模板後,都做一次小范围复查。把重复與聚合頁自查放進站点运营的固定检查項,比等蜘蛛抓取異常後再回头排查更省力。