重复内容不只在站外发生
谈到重复内容,很多人的第一反应是别人转载了自己的文章。但在收录层面,更常见、也更容易被忽略的,是同一个站点内部的重复:同一个商品有七八个规格 URL,同一项服务有几十个城市页面,内容只换了一个地名,正文其余部分一字不差。这些页面彼此之间互为重复来源,搜索引擎在决定收录哪些、留下哪些时,会做一轮筛选。
站内自重复的几种典型场景
- 多城市页:一份模板套出上百个城市,除了地名和电话,正文几乎相同。
- 多规格或多属性页:颜色、尺寸、套餐组合各自生成独立 URL,差异只在参数上。
- 筛选与排序页:列表页叠加筛选条件后,生成大量内容高度重合的 URL。
- 分页与归档:同一批文章在分类页、标签页、日期归档页反复出现。
- 多语言或多区域版本:不同语言版本之间只做了机器翻译,语义高度接近。
搜索引擎会怎么做取舍
面对一批相似页面,它通常不会全部收录并全部给予展示机会,而是倾向于挑选其中一个作为代表,其余的要么不收录,要么收录后长期不参与展示。挑选的依据往往是:哪个页面获得了更多外部链接、哪个页面更早被发现、哪个页面的内容更完整。
这个过程不受你控制,也不会有明确通知。表现出来就是:你发布了一百个城市页,索引报告里只增加了十几个,剩下的停在已发现或已抓取但未编入索引。
站内重复不会直接导致惩罚,但会稀释抓取机会和页面权重,让真正重要的页面更难被稳定收录。
处理思路:先分清哪些页面值得独立存在
- 有真实差异就保留,没有就合并。每个城市页如果有本地门店、本地案例、本地服务范围等真实内容,值得独立成页;如果只是替换了地名,合并成一个总页面更合适。
- 给代表页明确 canonical。多规格页若不打算各自参与搜索,可以指向主规格页,但要确认主规格页确实能覆盖用户需求。
- 控制筛选组合的抓取入口。筛选参数是给用户用的,不必让每个组合都被抓取。可以用 robots.txt 屏蔽无意义的参数组合,或在站内链接上收一收。
- 把归档页和标签页降级。这类页面更适合承担导航作用,若内容与分类页高度重合,可以设置 noindex,把收录机会留给文章本身。
- 差异化要落在正文,而不是标题。只改 title 和 h1、正文照搬,仍然属于重复内容。
自查时可以问的几个问题
- 把两个页面的正文并排放,去掉地名、型号之后还剩多少不同?
- 这个页面会有人单独搜索并点进来吗?还是只会从站内导航进入?
- 索引报告里,同一批模板页的收录比例是否明显低于其他页面?
- 被抓取次数最多的,是不是恰好就是这些高度相似的页面?
如果答案指向这些页面本来就不需要各自被收录,那么精简往往比扩充更划算。收录量不是越多越好,把有限的机会留给有独立价值的页面,整体表现通常更稳定。