網站收錄

站内重复内容:同一篇内容出現在多個 URL,索引里该留哪一版

同一篇内容常常能通過多個 URL 打開:列表頁輸出全文、打印版、标簽聚合頁、带跟踪參數的地址。本文先帮你区分真重复與模板相似,再按“定主版本—统一内鏈—给規范信号—收口次要版本”的顺序處理,並說明 canonical、noindex 與 robots.txt 各自能做什么、不能做什么。

網站收錄

站内重复内容:同一篇内容出現在多個 URL,索引里该留哪一版

先分清:重复是真重复,還是看起来像

站内出現多個可訪問的相似 URL,不等于都要清理。先按重复程度分组,再决定動作,能避免把本来正常的頁面誤伤。

  • 完全重复:同一段正文,通過不同 URL 都能完整打開,例如詳情頁的打印版、AMP 版、带會话或跟踪參數的版本。
  • 近似重复:正文一致,但标题、面包屑、侧栏推荐不同。最典型的是列表頁把摘要換成了全文輸出。
  • 模板相似:不同内容套同一模板,頁头頁脚一致但正文各不相同。這類一般不算重复内容,不需要處理。

真正需要收口的是前两類。第三類如果動了,反而可能切断正常的頁面發現路径。

常见的重复来源

  • 列表頁、标簽頁、聚合頁直接輸出全文,導致同一篇文章有多個完整版本。
  • 打印版、移動版、纯文本版等並存的舊模板地址。
  • 篩選、排序、分頁參數被组合出大量可訪問 URL。
  • 推廣連結里的跟踪參數,让同一頁面带上不同後缀。
  • 測試域名、舊域名、http 與 https、带與不带 www 同时可訪問。
  • 商品或内容的多個分類路径,都能到達同一個詳情頁。

這些来源里,有些可以在模板层一次性解决,有些只能逐類收口,成本差別很大,值得先排序。

處理顺序:先定主版本,再给信号

  1. 确定主版本。選一個结构稳定、以後不會再改的 URL 作為規范版本,其余都算副本。
  2. 统一站内連結。導航、面包屑、内鏈、分頁連結都指向主版本。内鏈是最直接的信号,比标簽更早生效。
  3. 加 canonical。让副本頁面在頁面級声明主版本地址。這一步是建议,不是命令。
  4. 收口次要版本。對确實不需要進索引的版本,用 noindex 标记;前提是這些頁面允许被抓取,否則标记讀不到。
  5. 清理 sitemap。站点地图只保留主版本,不要把副本一並提交。
canonical 是提示而不是指令。搜尋引擎仍可能根據自己的判断選擇另一版作為展示版本,所以不要把它当成刪除按钮,也不要用它来掩盖内容质量問题。

几個容易做错的点

  • noindex 頁面被 robots.txt 挡住。抓取被拦後,頁面上的 noindex 也無法被讀取,两邊信号會互相抵消。
  • 用 canonical 處理站外轉载。跨域场景下它只能表達意愿,最终以對方是否配合為准。
  • 分頁頁全部 canonical 到第一頁。這可能让後續列表里的新 URL 更晚被發現,通常不是好選擇。
  • 只改模板不改資料。舊參數地址仍在服務端返回 200,抓取时照样能訪問到完整内容。

怎么复查有没有收住

  • 在站点後台的頁面报告里關注“重复網頁,搜尋引擎選擇的規范網頁與用戶指定的不同”這一類提示,它是判断信号是否被采纳的直接入口。
  • 用站点查询粗看副本地址是否還留在索引里,注意查询结果只是粗略样本,不适合当精确計數。
  • 看服務器日誌,確認爬虫的抓取重心是否已经轉移到主版本。
  • 索引更新存在延迟,改動後给自己留出數周的观察窗口,中途反复改信号只會让判断更乱。

小结

站内重复的處理逻辑並不复杂:先按重复程度分组,選出唯一的主版本,用内鏈把權重和發現路径集中過去,再用 canonical 和 noindex 做补充說明。真正容易出問题的地方,往往是信号之間互相打架,以及改完之後没有复查究竟哪一版留在了索引里。