重复内容不只在站外發生
谈到重复内容,很多人的第一反應是別人轉载了自己的文章。但在收錄层面,更常见、也更容易被忽略的,是同一個站点内部的重复:同一個商品有七八個規格 URL,同一項服務有几十個城市頁面,内容只換了一個地名,正文其余部分一字不差。這些頁面彼此之間互為重复来源,搜尋引擎在决定收錄哪些、留下哪些时,會做一轮篩選。
站内自重复的几種典型场景
- 多城市頁:一份模板套出上百個城市,除了地名和电话,正文几乎相同。
- 多規格或多属性頁:颜色、尺寸、套餐组合各自生成獨立 URL,差异只在參數上。
- 篩選與排序頁:列表頁叠加篩選條件後,生成大量内容高度重合的 URL。
- 分頁與归档:同一批文章在分類頁、标簽頁、日期归档頁反复出現。
- 多語言或多区域版本:不同語言版本之間只做了机器翻译,语义高度接近。
搜尋引擎會怎么做取舍
面對一批相似頁面,它通常不會全部收錄並全部给予展示机會,而是倾向于挑選其中一個作為代表,其余的要么不收錄,要么收錄後長期不參與展示。挑選的依據往往是:哪個頁面获得了更多外部連結、哪個頁面更早被發現、哪個頁面的内容更完整。
這個過程不受你控制,也不會有明确通知。表現出来就是:你發布了一百個城市頁,索引报告里只增加了十几個,剩下的停在已發現或已抓取但未编入索引。
站内重复不會直接導致惩罚,但會稀释抓取机會和頁面權重,让真正重要的頁面更难被稳定收錄。
處理思路:先分清哪些頁面值得獨立存在
- 有真實差异就保留,没有就合並。每個城市頁如果有本地门店、本地案例、本地服務范围等真實内容,值得獨立成頁;如果只是替換了地名,合並成一個總頁面更合适。
- 给代表頁明确 canonical。多規格頁若不打算各自參與搜尋,可以指向主規格頁,但要確認主規格頁确實能覆盖用戶需求。
- 控制篩選组合的抓取入口。篩選參數是给用戶用的,不必让每個组合都被抓取。可以用 robots.txt 屏蔽無意义的參數组合,或在站内連結上收一收。
- 把归档頁和标簽頁降級。這類頁面更适合承担導航作用,若内容與分類頁高度重合,可以設定 noindex,把收錄机會留给文章本身。
- 差异化要落在正文,而不是标题。只改 title 和 h1、正文照搬,仍然属于重复内容。
自查时可以問的几個問题
- 把两個頁面的正文並排放,去掉地名、型号之後還剩多少不同?
- 這個頁面會有人單獨搜尋並点進来吗?還是只會從站内導航進入?
- 索引报告里,同一批模板頁的收錄比例是否明顯低于其他頁面?
- 被抓取次數最多的,是不是恰好就是這些高度相似的頁面?
如果答案指向這些頁面本来就不需要各自被收錄,那么精简往往比扩充更划算。收錄量不是越多越好,把有限的机會留给有獨立價值的頁面,整体表現通常更稳定。