索引为什么要做去重
搜索引擎的索引空间和抓取资源都是有限的。当多个 URL 承载几乎相同的内容时,系统通常只需要保留一个“代表页面”,其余地址要么被归并到代表页,要么长期停留在已发现但未索引的状态。这个过程更接近一种资源分配的选择,而不是针对某个站点的惩罚。理解这一点,才能判断自己站点的重复问题到底要不要处理。
重复内容常见的四种形态
1. 整页复制或采集
最直接的一种:正文、标题、排版几乎一字不差。如果内容是从别处搬来的,通常不会有好的结果;即使是自家站群里互相复制,也可能让搜索引擎只挑其中一条留下。
2. 同一内容的多个 URL
同一个页面可以通过多个地址访问:带不带 www、字母大小写、末尾有没有斜杠、有没有默认文档(/index.html 与 /)、参数顺序不同、加了跟踪参数。这些变体在索引里可能被合并,也可能各自留下一条,取决于规范化信号是否清晰。
- HTML 中的 canonical 是否唯一且自洽
- 内部链接是否统一使用同一个版本
- 是否做过 301 收敛
3. 模板与列表带来的局部重复
导航、侧栏、页脚、免责声明在每个页面都一样,本身不构成问题。但如果正文部分非常短,模板文字在页面里占了大头,页面的独立信息量就会很低,进入索引的优先级也随之下降。
4. 跨站转载与授权转载
同一篇文章出现在多个域名下时,先被发现、先被索引的一方更容易成为代表版本。转载方如果希望自己的版本被收录,需要让转载页面带上指向原文的规范标签,或者对转载内容做实质性的补充与本地化改写。
先判断要不要处理
不是所有重复都值得动手。可以用下面几步做一次粗略评估:
- 用站内搜索或 site 查询抽样,看同类内容在索引里留下了几条。
- 翻服务器日志,看这些重复 URL 是否在持续消耗抓取量。
- 看这些页面有没有带来访问、站内跳转或转化价值。
如果重复地址几乎不被抓取,也不带来任何价值,优先级可以往后放;如果它们明显占用了抓取配额,或让该收录的页面迟迟进不了索引,就值得处理。
确定主版本,再让信号统一指向它
处理重复的核心是明确每一份内容对应哪一个 URL,然后让所有信号都指向它:
- 站内链接统一使用主版本地址,包括导航、面包屑、Sitemap。
- canonical 写在重复页面上并指向主版本,注意不要互相指向形成环。
- 301 用于确定不再需要的地址;如果两个地址都要保留(例如不同投放渠道),再考虑 canonical。
- 参数地址能通过 robots.txt 或 noindex 挡住的,先想清楚它是否真的不需要出现在搜索结果里。
收敛动作做完之后,索引不会立刻同步。代表页面和变体页面之间的合并需要时间,期间看到的结果可能是混合的,不必每天改一次策略。
几个容易踩的误区
- 给所有重复页面都加 canonical,却让它们互相指向,信号等于互相抵消。
- 对想保留的页面用 noindex,同时又期待它被收录,这两件事是矛盾的。
- 只在 Sitemap 里提交主版本,站内链接却仍然指向旧地址。
- 把重复内容当成站点的头号问题,忽略了内容本身是否有独立价值。
小结
重复内容的处理,本质上是在帮搜索引擎做选择:告诉它哪一条地址是主版本,其余地址不需要单独占用索引位置。先判断影响范围,再统一链接与规范化信号,最后给它一些时间生效,通常比反复调整策略更有效。