提到重复内容,多数站点第一反应是“别人抄了我的文章”。但在收录层面,更常见的情况是自己站内生成了一批高度相似的页面,彼此争夺同一个索引位置。这类页面往往不是抄来的,而是模板、参数和分页在批量生成时自然留下的产物。
一、模板批量生成的近似页面
列表页、标签页、筛选结果页通常共用同一套模板,正文区域只有几条链接,标题由变量拼出来。当筛选条件组合过多时,会生成大量内容差异极小的URL。搜索引擎抓取这些页面本身没问题,但在判断“这个URL代表什么内容”时会遇到困难。
判断方法很简单:把两个页面的正文去掉导航和页脚后放在一起看,如果剩下的实质内容差异不足两三成,它们大概率属于同一类近似页面。
二、参数制造的近似URL
排序参数、追踪参数、会话ID、每页条数,都会让同一份内容对应多条URL。常见形式包括:
- 排序与视图参数:sort=price、view=list,内容相同只是顺序不同;
- 追踪参数:utm_、from=、ref= 等,多用于统计,对内容没有影响;
- 会话与筛选参数:sid=、filter=,容易随用户操作无限扩展。
处理时先确认哪一条是规范版本,再通过 canonical、robots 或站内链接控制其余版本的抓取与索引,避免同一份内容被拆成多份。
三、分页与聚合页的重叠
分页序列、按时间归档、按分类聚合,这三类页面经常互相重叠。第2页的内容可能和某个标签页高度一致,聚合页又可能和详情页共享大段摘要。搜索引擎需要判断哪一版是“完整内容”的代表,如果站点自己不表态,就容易出现版本反复替换。
站点可以做的整理
- 先列出所有会批量生成URL的模板,标注用途;
- 区分“给用户看的”和“给抓取用的”,后者不必全部开放索引;
- 为每类页面指定唯一的规范版本,并在站内链接中统一指向它;
- 观察抓取与索引状态,确认调整后是否按预期收敛。
整理重复内容的目的不是追求“页面越少越好”,而是让每个值得被索引的URL都有清晰的代表身份。
四、整理之后要观察什么
调整完成后,不要只看抓取量。更值得关注的是索引状态是否稳定、规范版本是否被选中、近似页面是否逐步退出索引。如果一段时间后状态没有变化,回头检查站内链接是否还在指向旧版本,或者站点地图里是否仍保留了大量近似URL。
重复内容的处理往往不是一次性的,新模板、新筛选条件上线后都可能重新引入问题。把上面这套检查做成固定动作,比事后集中清理更省力。