提到重复内容,很多人的第一反應是「有人抄了我的文章」。但在日常站点里,真正拖累收錄的重复,更多来自自己站内的模板、參數和多語言版本。這類重复不會报错,後台也不會提醒你,只是让搜尋引擎在多個相似 URL 之間反复選擇,最後被留下的那一個,未必是你想要的那個。
先分清重复内容的几種来源
一、正文高度相似的頁面
两個頁面主体内容几乎一致,只有标题或一两段话不同。常见于同一篇内容發在不同栏目、不同分類下,或者各地分公司頁面共用一套公司介绍。這類重复最容易被人工發現,也最容易判断。
二、模板造成的重复
列表頁、标簽頁、篩選结果頁往往共用同一套模板,正文区域只有几條摘要,其余全是導航、推荐位和頁脚。這類頁面單看每個 URL 都有内容,但彼此差异极低,數量却可以很大。它們是不是「重复」,取决于篩選出来的结果是否真的构成一個獨立主题。
三、參數與多版本 URL
排序方式、追踪參數、大小寫差异、带不带结尾斜杠、http 與 https,都可能让同一份内容對應多個地址。字符串层面它們是不同 URL,内容层面它們就是同一個頁面。
四、多語言與多地区版本
同一商品的中文頁和英文頁、面向不同地区的落地頁,结构接近但服務對象不同。這類「重复」是有意為之,處理方式與前三種完全不同,不能一概而论。
搜尋引擎一般會怎么處理
面對多個相似頁面,它通常會尝试挑出一個它認為更合适的版本作為代表,其余版本可能被归並、降低抓取频率,或者進入索引但不單獨展示。這個過程没有對外開關,也不會通知你選了哪一個。所以判断依據要從自己這邊找:看日誌里哪些 URL 被抓得频繁、哪些几乎不被訪問,看站内有没有给出明确的規范化信号,看同一批頁面的收錄比例是否明顯低于其他板块。
需要明确的是,重复内容在多數情况下是一個「選擇問题」,而不是處罚問题。真正带来损失的,是抓取预算被大量相似 URL 消耗掉,導致有價值的新頁面排队變慢。
處理顺序:先判断意图,再選手段
- 先問這些頁面是不是同一件事。同一件事,就往归並方向走;确實是不同的事,就要给出能让机器区分的信号,而不是指望它自己猜。
- 能合並的優先合並。同一篇内容發在多處,最省事的做法是只保留一個主版本,其他位置用連結指向它,而不是把正文再複製一遍。
- 不能合並的,用 canonical 表達首選。canonical 是建议而不是命令,只有在两個頁面确實高度相似时它才容易被采纳;如果頁面差异明顯,效果往往不理想。
- 參數類 URL 走規范或抓取限制。排序、追踪參數通常不需要單獨收錄;分頁則要看它是否真的提供了獨立的检索價值,再决定保留還是收敛。
- 多語言用 hreflang,不要用 canonical。把不同語言版本互相 canonical,等于直接告诉搜尋引擎只保留其中一個,另一個語言的使用者會看不到對應頁面。
几個常见誤区
- 以為加了 canonical 就一定生效。它只是提示,頁面本身差异過大时,搜尋引擎可以不予采纳。
- 以為 robots.txt 能解决重复。阻止抓取不等于阻止收錄或归並,被外鏈指向的 URL 仍可能出現在索引里。
- 以為模板頁必须全部删掉。有真實检索需求的篩選组合可以保留,前提是它與其他组合有實质差异。
- 以為只有站内重复才算重复。同一份内容授權發布到多個站点,同样會形成跨站選擇,處理时更依赖規范信号和外鏈指向。
處理重复内容的目标不是「让所有 URL 都被收錄」,而是让搜尋引擎在面對多個相似頁面时,能明确知道哪個是你希望被看到的那一個。