站内重复内容不一定是“作弊”,但它会让搜索引擎在多个相似页面之间做选择。选择本身需要成本:抓取、对比、判断哪个URL更适合作为代表。结果就是,有些页面迟迟不进索引,或者进了又被替换掉。
先分清重复的类型
处理之前,先看重复发生在哪一层。不同层级的重复,收录取舍完全不同。
- 完全重复:多个URL输出几乎一样的内容,比如打印页、带追踪参数的地址、同一商品的不同排序参数。
- 部分重复:列表页包含详情页的摘要甚至全文;详情页之间只有少量参数不同。
- 模板重复:分类页、标签页、筛选页共用一套模板,只有标题和商品列表变化。
完全重复通常需要收口;部分重复要看页面是否承担独立功能;模板重复则要评估有没有独立的搜索需求。
收录取舍的三个问题
不是所有重复页面都要处理。每决定一个页面的去向,先问三个问题。
- 用户会不会直接搜到它?如果用户可能搜索“某某品牌 价格筛选”并希望落到筛选页,这个页面就有独立价值。
- 它是不是唯一的落地页?如果详情页被删掉,用户只能从列表页进入,列表页就不能简单收口。
- 它是否在分发内链?很多列表页本身内容重复,但它是蜘蛛发现详情页的重要入口。直接noindex或删除,可能让详情页更难被抓到。
如果三个问题的答案都是“否”,这个页面就可以考虑合并或收口。只要有一个答案是“是”,就要谨慎。
常见处理方式与注意点
保留并规范
如果页面有独立价值,保留它,但用 canonical、内链和 sitemap 保持一致信号。canonical 指向的页面要和内链、sitemap 里的首选地址一致,别一边 canonical 指A,一边内链全用B。
合并同类页面
多个页面只是参数或措辞不同,没有独立搜索需求,就合并成一个,旧地址做301。合并后更新内链和 sitemap,别让旧地址继续被蜘蛛反复抓到。
收口但不阻断抓取
想不让某个页面进索引,用 noindex 比 robots.txt 更合适。robots.txt 拦住抓取后,搜索引擎看不到 noindex,索引里可能继续保留旧URL。要收口,先让页面可抓取,再给 noindex,或者用 canonical 指向代表页。
重复内容通常不是惩罚问题,而是选择问题。减少选择成本,比追求“每个URL都收录”更实际。
几个容易踩的坑
- 把所有列表页、标签页统一 noindex,结果详情页失去内链入口,抓取变慢。
- 为了增加收录量,批量生成只有关键词不同的聚合页,这些页面既没有独立需求,又稀释了站内质量信号。
- 只改 canonical,不改内链和 sitemap,信号互相矛盾,蜘蛛仍然在多个URL之间来回切换。
- 把“收录量下降”直接当成惩罚,急着删页面。先看是不是重复页面被正常收敛,再看核心页面有没有受影响。
回到目的
收录是为了让有价值的页面进入索引,不是让每个URL都出现在搜索结果里。站内重复内容处理得好,蜘蛛能把时间花在详情页、原创内容和真正有搜索需求的聚合页上;处理得不好,要么浪费抓取预算,要么误伤入口页面。
动手前先列一遍站内主要页面类型,标出哪些有独立搜索需求、哪些只是导航或筛选。按类型定策略,比一个一个页面改 canonical 更省事。