内容重复不一定指文字一模一样。只要能通过多个地址访问到同一批主体内容,或者多个地址的页面主体高度相似、只有排序或参数不同,就属于需要留意的重复。站点越大,标签页、筛选页、归档页越多,这类地址就越容易堆积,蜘蛛的抓取额度也容易被它们分散。
常见的重复来源
- 标签与专题聚合页:同一篇文章被多个标签收录,生成多个只有列表顺序不同的地址。
- 参数页:排序、筛选、跟踪参数让同一列表出现多种 URL。
- 打印页与独立移动版:如果它们各自拥有可访问地址,又没做规范处理,就容易和主页面重复。
- 自动归档:按日期、按作者、按分类生成的列表页,内容往往大量重叠。
- 空页面:没有内容的标签、分类、专题,CMS 仍然返回正常状态码。
自查方法
- 从服务器日志里找出被频繁抓取的地址,看它们是否属于同一批内容。
- 用站内爬虫或日志把返回正常状态码的地址与页面主体做比对,标记高度相似的页面。
- 检查 canonical:重复页面是否指向了规范地址,规范地址是否与站点地图、内部链接一致。
- 检查聚合页的独特性:如果标签页只有标题列表,没有说明、没有筛选价值,就要重新判断它是否值得保留。
- 检查内部链接:导航、标签云、相关推荐是否把大量入口指向了低价值聚合页。
- 检查 robots 与 meta robots:是否误屏蔽了规范页面,或者放行了不该被抓取的地址。
容易被忽略的细节
- 排序参数不同但内容相同,比如 asc 与 desc 各自对应一个地址。
- 分页第一页与不带分页参数的地址同时存在。
- 大小写、末尾斜杠、http 与 https 混用造成的多地址。
- 站点地图和内部链接指向了不同版本。
处理思路
处理的目标不是把所有相似页面删掉,而是让每个保留的地址都有明确用途。
- 合并:把含义相近的标签合并成一个,旧地址做跳转。
- 差异化:给聚合页加一段说明、筛选条件或人工挑选的推荐,让它有独立价值。
- canonical:对于必须保留但内容高度相似的页面,用 canonical 指向主版本。
- noindex:对于没有搜索价值的筛选页、打印页,可以只让用户访问,不让蜘蛛收录。
- 内链:把主要入口指向规范页面,减少指向重复地址的链接。
- 站点地图:只提交规范地址,避免把重复页一并提交。
不要为了省事把所有聚合页一刀切 noindex。有些专题页本身有用户需求,删掉反而损失入口。判断标准是它能不能独立满足一次访问。
定期复查
内容重复不是一次性任务。栏目调整、新标签、新筛选条件都会带来新的重复地址。建议在每次改版、上新栏目、调整模板后,都做一次小范围复查。把重复与聚合页自查放进站点运营的固定检查项,比等蜘蛛抓取异常后再回头排查更省力。