先分清重复的层次
站点里出现两段相似的内容,本身不是故障。搜索引擎在抓取和建立索引的过程中会做去重与规范化,站内存在一定程度的重复是很常见的现象。真正需要动手的情况,通常是重复已经影响到抓取资源的分配,或者让蜘蛛在多个版本之间来回选择,导致某个版本迟迟拿不到稳定的信号。
所以动手之前先分类。下面这几类来源,处理方式差别很大,混在一起改容易误伤本来不需要动的页面。
常见的几类站内重复来源
模板与通用文案
页头、页脚、侧边栏、版权声明、配送政策、免责说明,这些内容在每个页面都一样。单独看它们信息量不大,但如果正文本身很短,模板部分就会占据页面的大部分文本。判断方式不是看有没有重复,而是看正文与模板的文字比例。
URL 参数与会话标识
来源追踪参数、排序参数、分页参数、会话 ID 会让同一个页面产生多个可访问地址。这类重复的特征是:URL 不同,返回的 HTML 几乎完全一样。可以先从访问日志或服务器配置里确认哪些参数是功能必需的,再决定剩下的怎么处理。
同一内容挂在多个栏目
一篇文章同时属于「行业资讯」和「案例分享」,如果两个栏目各自生成独立地址,就会出现两个内容一致、路径不同的页面。这类重复通常有一个更合理的主归属,可以结合内链结构和面包屑来判断哪个版本更值得作为入口。
列表页与摘要页
列表页会截取正文前几段做摘要,当站点列表页很多、每页条目很少时,摘要文字与正文的重叠比例会变得很高。tag 页、作者页、站内搜索结果页也属于这一类,它们的共同点是页面内容由其他页面拼装而来。
多终端与打印版本
移动站、打印页、导出页、精简版,如果各自有独立 URL 且彼此之间没有指向关系,也会形成一组重复。响应式布局通常不涉及这个问题,独立域名或独立路径才需要处理。
判断是不是真重复的几个检查点
- 两个地址去掉导航和页脚后,正文主体文字是否基本一致
- 两个地址是否都有站内链接或外部链接指向
- 其中一个是否有独立的搜索需求,比如打印版、移动版有单独入口
- 两个版本的更新时间是否同步,是否有一方长期不维护
- 是否有一个地址能作为明确的主版本,其余地址绕不开它
如果几个检查点都指向同一个结论,处理起来就比较清楚;如果结论互相矛盾,往往说明这几个页面承担的功能不同,不宜一刀切。
处理顺序可以这样排
- 先处理完全等价、且没有任何独立价值的地址,比如追踪参数页、会话链接、打印页。
- 再处理多栏目、多分类造成的重复,先确定一个主归属,再让其他入口指向它。
- 然后看列表页与摘要页,判断哪些需要保留、哪些可以收敛数量。
- 最后才考虑模板层面的调整,这部分通常动作最大、单页收益最小。
别把重复当成收录问题的万能解释
重复内容只是收录问题的一种成因。抓取预算不足、服务器响应慢、内链入口缺失、页面本身信息量偏低,都可能造成类似的表面现象。如果只是发现几个相似页面,不一定要立刻改站点结构,先确认这些页面是否真的影响了其他页面的抓取与收录,再决定是否动手。
改动之后也需要给蜘蛛重新抓取和重新评估的时间,期间索引状态出现波动属于正常过程,不必因为一两天的变化就再次大改。
重复内容的处理目标,是让主版本的信号更清晰,而不是把所有相似页面都删干净。