很多人把“重复内容”理解成两篇一模一样的东西。实际在搜索索引里,更常见的是近似重复:模板相同、正文主体高度相似,只差标题、价格、地区或几行描述。这类页面被抓取的概率不低,但往往只有一部分进入索引,剩下的会被归并或按低价值处理。
重复的三种类型,处理方式不一样
- 完全副本:同一篇内容出现在多个 URL 上,比如 http 与 https、带不带 www、参数版和干净版。这属于 URL 规范化问题,收敛成本最低。
- 近似重复:同一套模板下批量生成的页面,正文主体有七八成重合。常见于聚合页、地区页、SKU 变体、标签页。
- 意图重复:页面文字不同,但解决的是同一个搜索需求。这类不靠技术手段解决,靠内容取舍。
需要区分“重复”和“相似”。搜索引擎做的是聚类和选主版本,偶尔出现同一组里两个页面都进索引,或者主版本换人,都属于正常波动。判断是否要动手,看的是这一组页面是否长期占用了本可以留给其他页面的抓取与索引位置。
判定信号:几条低成本自查
- 去掉导航、页脚、侧栏之后,正文主体还剩多少独有段落;
- 两个页面的首段结构和 h2 层级是否几乎一致;
- 差异是否只落在几个可变量上,比如价格、城市、型号、年份;
- 标题标签除变量外是否完全相同;
- 内链是否只指向自己那一版,从不互相引用。
一个简单办法:随机抽二十组相似 URL,把正文复制成纯文本对比。如果差异字数不到全文的两成,基本可以按近似重复处理。另一个信号来自服务器日志——同一组页面被反复抓取,但索引状态报告里始终只有一两个,说明抓取端已经把它们当成一件事。
处理顺序:先定主版本,再谈收敛
- 确定业务主版本。看三件事:哪一版有自然外链和入口、哪一版转化更好、哪一版内容最完整。别默认“先发布的”就是主版本。
- 确认主版本本身可抓可索引。检查 robots、noindex、canonical 是否自指、服务器是否稳定返回 200。主版本自己出问题,后面的收敛都白做。
- 用 canonical 把变体指过去,而不是用 noindex 一刀切。canonical 是提示而非指令,搜索引擎仍会自行判断,但它能明显减少歧义。
- 近似重复页考虑合并或差异化。合并是把内容并到一个 URL 再 301;差异化是补上独有信息,让它值得单独存在。二选一,别两件都不做。
- 检查入口和内链。被收敛的页面如果还在导航、面包屑、相关推荐里大量出现,抓取端会持续访问,收敛效果会被稀释。
- 观察一到两个抓取周期再调整。重复判定和索引更新都有延迟,频繁改动只会增加噪音。
不要用 canonical 掩盖内容问题
有些页面之间不是“谁抄谁”,而是两篇都写得太薄。这时加 canonical 只是把问题藏起来:索引里少了几个薄页面,用户的需求仍然没被满足。该做的是把内容做厚,或者干脆合并成一页。
几个常见坑
- 给所有变体都加 noindex,结果主版本被顺带屏蔽;
- canonical 指向一个 404 或并不存在的 URL;
- 用 301 把带流量的旧页面统一跳到首页,等于放弃原有的相关性;
- 把“被抓取”直接当成“被收录”,重复页面在日志里刷得很勤,索引里却一个都没有。
重复内容处理的目标不是让页面数量变少,而是让每一组相似页里,留下一个最值得被索引的版本。
收尾时做一张表:主版本 URL、变体 URL、当前状态(可索引或已排除)、处理动作、复查日期。比反复猜搜索引擎怎么想要有效得多。