重复内容不是“惩罚”,而是让搜尋引擎做選擇
同一個頁面如果存在多個可訪問 URL,搜尋引擎通常不會全部收錄展示,而是挑一個作為代表,其余归入重复或低優先級。结果是索引量可能虚高,抓取预算被分散,真正想推的頁面反而拿不到稳定信号。
把重复内容当成“需要收拾的副本”,而不是“越多越好”。
先分清三類重复来源
- 站内參數重复:追踪參數、排序參數、會话 ID、打印頁、AMP 版等。
- 站内结构重复:大小寫、结尾斜杠、www 與非 www、HTTP 與 HTTPS 混用。
- 跨站或相似内容:轉载、镜像、聚合頁、篩選頁内容過薄。
前两類通常可以靠規范和技術設定解决,第三類要结合頁面價值决定是否保留。
用三個地方核對重复情况
- 索引报告:看“重复,未選為規范頁”等排除原因。
- 抓取日誌:看同一内容被哪些 URL 反复抓取。
- 站内搜尋:用 site: 查主關鍵詞,看實际展示的是哪個 URL。
三處對不上很正常,先以索引报告為主,再用日誌驗證抓取是否集中在少數 URL。
處理顺序:先定主 URL,再统一信号
1. 确定主 URL
選内容最完整、内鏈最多、訪問稳定、结构最简洁的那個。不要選带一堆參數或临时跳轉的 URL。
2. 寫自引用 canonical
每個頁面都寫指向自己的 canonical,重复頁的 canonical 指向主 URL。避免 A 指向 B、B 又指向 C。
3. 舊副本用 301 合並
如果舊 URL 没有獨立訪問價值,直接 301 到主 URL,比只寫 canonical 更干净。有獨立價值的内容頁則保留並差异化。
4. 參數頁按用途處理
只影响展示、不影响内容的參數,用 canonical 指向無參數版;纯追踪參數可在服務器端忽略或做 301。需要挡在索引外的,用 noindex,不要用 robots.txt 屏蔽後還期待 noindex 生效。
5. 内鏈和 sitemap 统一指向主 URL
内鏈是强信号。導航、面包屑、相關推荐、sitemap 里尽量只出現主 URL,减少搜尋引擎再次發現副本。
几個常见誤区
- 给所有重复頁加 noindex:可能誤伤有流量或可合並的頁面。
- canonical 和 301 指向不同:信号互相打架。
- 频繁更換主 URL:让搜尋引擎反复重新判断。
- 只改 sitemap 不改内鏈:内鏈仍會把副本喂给爬虫。
改完後的观察节奏
處理完成後,通常需要几周時間看變化。重点看三件事:主 URL 是否稳定被抓取和展示;重复 URL 在抓取日誌中的訪問是否下降;索引报告里“重复未選”的數量是否减少。不要每天改一次 canonical,也不要因為短期没變化就急着換方案。
重复内容處理的终点,是让搜尋引擎少做選擇,把抓取和索引集中到真正想被看到的頁面上。