很多站点在做收录核对时,注意力都放在外链、蜘蛛日志、sitemap 上,却容易跳过一个问题:同一篇内容在站内出现了好几个 URL。栏目页、专题页、标签页、移动版、打印版、带参数的版本,这些地址各自都能正常打开,内容主体却差不多。等到真正去看索引时,往往发现里面躺着的是某个并不重要的版本,而想推的那个地址反而没进去。遇到这种情况,先别急着改模板,把站内重复的版本理清楚更要紧。
站内重复通常从哪来
- 编辑把同一篇稿子同时挂到多个栏目,每个栏目生成一个独立 URL
- CMS 自动生成的标签页、聚合页,把摘要连同正文一起输出
- 专题页把文章正文整段复制过来,只改了标题和头部
- 打印版、移动版、带跟踪参数的版本各有一套地址
- 旧栏目改版后内容迁移,老地址没有处理干净,和新地址并存
这些来源里,有些是模板设计带来的,有些是编辑习惯造成的。做核对时不用急着判断谁对谁错,先把「哪些 URL 装的是同一份内容」列出来。
重复内容会带来什么麻烦
面对多个内容相近的地址,搜索引擎需要自己判断哪个是主版本。这个判断过程会占用抓取配额,也可能让原本集中的信号被分散到不同地址上。这不等于一定不收,但常见的结果是:索引里选中的版本和你的预期不一致,或者几个版本互相替换,收录状态来回摆动。对抓取预算有限的中小站点来说,这种消耗尤其不划算。
所以站内重复更像是一个版本管理问题,而不是内容质量问题。核对的目标是让同一份内容只有一个明确的代表地址。
收录核对时按这几步走
- 抽样:从每个栏目、每种模板各取三到五个地址,看索引里留下的是哪个版本,记下它的来源
- 分组:把内容主体基本相同的地址归到一组,标注每个地址由哪套模板生成
- 定主版本:每组只保留一个对外主地址,通常选信息最全、更新最及时、内链最多的那个
- 处理非主版本:能用 canonical 的指回主版本;纯重复又没有独立价值的用 301 到主版本;需要保留但不希望进索引的(打印版、参数版等)用 noindex 或 robots 规则挡掉
- 复查内链:把站内指向非主版本的链接改成指向主版本,别让入口继续分散
- 观察:改完当天不要下结论,给抓取和重新判断留出时间,过一段时间再看索引里留下的版本是否稳定
定主版本时的几个判断点
- 正文是否完整,有没有被截断或只留摘要
- 更新是否及时,页面上的时间信号是否可信
- 站内是否有足够的内链指向它,是不是孤岛
- URL 是否干净稳定,不依赖一长串参数
哪些情况不必强行合并
如果两个页面的目标关键词、内容侧重确实不同,只是部分段落重合,那未必算重复。硬合并反而会丢掉原本的流量入口。判断标准可以简单一点:用户同时看到这两个页面,会不会觉得就是同一篇东西。会,才按重复处理。
处理完还要回到收录核对本身
理清重复内容,解决的是「该收哪个版本」,不是「一定收多少」。做完之后仍然要回到抓取日志、状态码、sitemap 这些基础项上,确认主版本能被正常抓取、能正常返回内容。主版本定得再清楚,如果蜘蛛拿到的是一张空壳或者一个错误码,前面的整理也落不了地。
站内重复不是先改模板就能解决的,先把同一份内容的主版本定下来,再谈收录核对的其他环节。