很多站点并不是被外部抄了内容才出现重复,而是自己内部就有了好几份。一篇文章同时发在“行业资讯”和“公司动态”,又被标签页、专题页各摘一段,再加上按分类筛选出的列表页,搜索引擎抓到的同一份内容就有好几个地址。这种情况下,收录本身通常不会出问题,麻烦在于最后被选中的版本不一定是你想推的那个。
站内重复的几种常见来源
- 多栏目同时发布:同一篇稿子挂到两个以上栏目,产生两个正式 URL。
- 标签页与聚合页:用列表或摘要把正文再放一遍,标题和描述高度相似。
- 筛选、排序、分页参数:同一批内容生成大量只差参数的地址。
- 版本类页面:打印版、分享版、移动版等与正文页并存。
- 正文改写但骨架相同:针对不同地区或渠道改几个词,其余完全一致。
搜索引擎遇到重复时会怎么做
大体上是先聚类,再在同一个簇里挑一个代表地址进入索引,其余的要么被合并,要么长期停留在“已发现未收录”的状态。这个挑选过程会参考链接指向、URL 结构、页面完整度、抓取先后等因素。也就是说,你在内链里一直推的地址,不一定是最后被展示的那个。
需要留意的是,重复并不等于惩罚。真正的代价是权重被分散到多个地址上,以及你无法控制展示的是哪个标题、哪个摘要、哪个链接。
先排查,再动手
- 用站点查询看索引里同一篇内容出现了几个地址。
- 拿文章标题的关键片段加引号搜索,看结果是否来自多个 URL。
- 抓一遍全站,比对标题和正文相似度,标出高度重合的组。
- 对照服务器日志,看蜘蛛是否在多个相似地址之间反复抓取。
处理顺序:能合并的先合并
如果两份内容确实只需要一份,最干净的做法是保留一个正式地址,其余做 301 指向它,并把内链统一改过来。这不是“删页面”,而是把入口收拢到一个地址上。
如果两份都必须保留,比如不同栏目确实有各自的导航意义,那就用 canonical 指明主版本,同时保证主版本的正文更完整、内链更多。canonical 是建议而不是命令,搜索引擎仍可能按自己的判断做选择,所以页面本身的一致信号越多越好。
标签页和聚合页要按价值区别对待:能带来真实流量的,保留并让它有自己的独特说明;只是自动罗列内容的,可以考虑收进 robots 或加 noindex。参数页则通过统一规范、限制可抓取参数组合来减少地址数量。
把问题挡在发布前
新内容上线时先问一句:这篇文章的正式地址是哪一个?多栏目发布时,只在一处放正文,其余位置用指向正式地址的入口或简短介绍。标签命名尽量沿用已有词,不要为同一主题反复新建近义标签。列表页和专题页保持标题、摘要上的差异,避免整页复制。
几个容易做过头的地方
- 为了防重复,把有自然流量的旧地址直接 noindex,结果入口没了。
- 全站套用 canonical,连本来就该独立的页面也指向首页。
- 改完当天就下结论,实际上索引更新需要一段时间才能反映出来。
站内重复更多是“地址管理”问题,不是内容质量问题。把同一份内容尽量收拢到一个地址,剩下的交给时间观察。