同一个站点里出现内容相近的页面很常见,它本身并不是惩罚,真正麻烦的是索引归属被摊薄:搜索引擎要多花成本判断该留下哪一版,你也更难判断流量到底该落在哪个 URL 上。处理重复内容的目标不是删页面,而是把收录归属收拢到你想被搜到的那一版。
先分清重复属于哪一种
- 完全重复:同一篇正文被复制到多个 URL,常见于多域名、测试环境、旧路径未清理。
- 结构重复:正文相同,只是参数、排序、分页或模板版本不同。
- 近似重复:主题相同、措辞不同,比如不同地区或品类的介绍页、批量生成的问答页。
- 片段重复:产品参数表、引用段落、用户评论等局部重合,通常不构成问题。
判断基准是去掉导航、页脚、推荐位之后的主体内容,而不是整页 HTML 的相似度。整页相似度高但正文各不相同,往往不用处理。
第一步:把重复范围圈出来
用站内搜索、抓取工具或日志,先找出可能成组的 URL,再抽取主体文本比对。重点看三件事:正文重合到什么程度、这些 URL 是否都有站内入口、它们是否都在 sitemap 里。只有先确定范围,后面的动作才不会误伤正常页面。
第二步:按类型决定处理方式
同一内容多个 URL:收敛到主版本
- 确定一个主版本 URL,其他版本用 301 指向它,前提是这些版本没有独立的外部价值。
- 无法跳转的(如带参数、带 session 的地址),用 canonical 指向主版本,并保证主版本自指。
- 站内链接、面包屑、sitemap 只保留主版本,避免自己把权重分散出去。
- 清理完再观察,不要一边收敛一边继续生成新的重复入口。
近似重复:先合并,再考虑改写
这类页面往往来自模板化生产,比如几十个地区的服务介绍。判断依据是它是否服务不同人群或地区、是否有独立信息。
- 能合并的合并成一个更完整的页面,把差异信息集中呈现。
- 必须保留的,补充本地数据、案例、价格或流程说明,让正文有实质差异。
- 标题与首段要能反映各自的重点,不要只替换地名。
- 用内链说明它们之间的关系,帮搜索引擎理解各自定位。
片段重复:一般不用动
参数表、免责声明、评论区重合属于正常现象。除非某个页面的正文几乎全部由引用和他站内容组成,否则不必专门处理。
处理时容易做错的地方
- 直接给大批页面加 noindex,结果连正常入口一起屏蔽。
- canonical 互相指向,A 指 B、B 指 A,等于没做。
- 只改 canonical,不改内链和 sitemap,信号互相矛盾。
- 把分页和筛选页全部屏蔽,导致深层内容失去发现入口。
- 重复还没收敛,就批量上新页,抓取预算继续被摊薄。
处理之后的观察顺序
- 看被选中的规范版本是否集中在主 URL 上。
- 看抓取频次是否从重复地址转移到主版本。
- 看主版本的曝光与点击是否更集中,而不是继续四处分流。
- 看索引量下降的同时,有没有有效页面一起掉出去。
重复内容的处理本质是一次收敛:先定主版本,再决定跳转、合并还是改写。把归属定清楚之后,再谈内容优化才不会被自己制造的多个入口拖住。