同一個内容在站内出現两次以上並不少见:列表頁把正文摘要又輸出了一遍、移動版和 PC 版各自一個 URL、活動頁複製了去年的模板只改标题、商品描述從供應商那里原样搬来。這些頁面都能被抓取,但真正常留在索引里的往往只有一個。搞清挑選逻辑,比反复提交有用。
先分清重复是怎么来的
- 技術性重复:同一内容、多個 URL。參數、大小寫、http/https、带 www、打印版、排序篩選都算,問题主要在 URL 层面收敛。
- 内容性重复:URL 不同,正文高度相似。分销商品描述、多城市落地頁只換了地名、聚合頁拼凑摘要,都属于這一類。
- 跨站重复:你的正文被別站轉载,或者你轉载了別人的。
後两類不是加一個 canonical 就能自動解决的,需要先判断這些頁面是否都有必要被搜到。
代表頁是怎么被挑出来的
面對一组相似頁面,搜尋引擎通常只保留一個作為可检索结果,其余归入“重复、未選中”。挑選没有公開公式,但可以從几個维度去推测:
- 哪個 URL 更早被發現,並且有相對稳定的外部連結;
- 站内連結更多指向哪一個;
- 頁面上的 canonical 指向谁;
- 谁的正文更完整、含有獨有信息,而不是模板加變量;
- URL 是否更简洁、层級更浅。
這也不是“谁先被收錄就永遠归谁”,後續替換代表頁的情况同样會發生。
重复本身不等于惩罚
需要說明的是,大部分重复内容不會被当作作弊處理。真正的代價是:一组頁面里只有一個能拿到收錄名額和曝光机會,其余即便被抓取,也可能長期停在“重复”狀態,白占了抓取與维護成本。
自查:找出站内的重复簇
- 用 site: 加正文中一句較獨特的句子(带引号)去查,看同一段话對應几個 URL。
- 翻站内搜尋或服務器日誌,找标题、描述完全相同但路径不同的頁面。
- 抽几個同模板頁面,去掉導航和頁脚後比對正文相似度。
- 检查舊域名、子域、測試环境是否還在线上可訪問,這類頁面常被忽略。
處理顺序
第一步,判断是否只需要一個頁面被搜到。如果是,做收敛:把次要 URL 301 到主 URL,canonical 指向主 URL,並且把内鏈改指主 URL。注意 canonical 與 301 指向不一致时會互相打架。
第二步,如果都需要保留,就要制造真實差异。城市頁只改地名属于低质差异,容易被判定為同一套内容,需要补充当地實际信息,否則很可能長期不被選中。
第三步,都不要、只想让人訪問的頁面。加 noindex 或做權限控制。注意 noindex 指令需要頁面能被抓取才能讀到,如果同时用 robots.txt 拦截,指令永遠讀不到,頁面反而可能留在索引里。
第四步,跨站轉载。能联系對方加 canonical 或注明来源最好;做不到的话,就让自己的版本拥有獨特内容與稳定外鏈,让選中的是你這一版。
几個容易誤判的点
- “重复”是按正文整体和段落相似度判断的,标题相同不等于内容重复。
- 加了 canonical 不等于立刻生效,要等頁面被重新抓取並處理。
- 如果主 URL 本身被 noindex,一组頁面都指向它,可能會導致整组都不出現在结果里。
- 參數篩選頁之間正文几乎一样,但排序不同,先看有没有真實搜尋流量,再决定是否 noindex。
- 内容重复率高的站,索引报告里“已收錄”數量可能正常,能带来曝光的有效頁面却很少,看資料时別只盯總數。
可以把重复内容当成一次清理机會:優先處理“同一内容存在多個可訪問 URL”和“模板批量生成的低差异頁”,收敛完成後留出一轮抓取周期,再观察索引與曝光的變化。