网站收录

怎么判断两个页面算不算重复:正文、模板与聚合部分的对照方法

判断两个页面是否重复,不能只看地址像不像。先把模板部分排除,比较每个页面独有的正文,再看聚合输出、参数变体和多规格共用描述这几种形态。本文给出可以对照的几个指标,以及保留、合并、收口的处理顺序,并说明抓取和收录在重复问题上的不同表现。

网站收录

怎么判断两个页面算不算重复:正文、模板与聚合部分的对照方法

判断重复,最先要做的不是打开工具,而是把「这一页独有的内容」和「每个页面都有的部分」分开。分开之后,很多看起来重复的页面其实不重复,很多看起来不同的页面其实是同一份内容换了排版。

第一步:划定正文主体的边界

导航栏、面包屑、页脚、侧边推荐位、版权信息,这些属于模板。它们在所有页面都出现,不参与重复判断,但会稀释正文占比。可以把页面文字复制出来,去掉这些块,剩下的才是需要比较的部分。JavaScript 渲染的页面要注意:直接取 HTML 源码可能拿不到主体内容,需要看渲染后的结果。

重复的几种常见形态

  • 模板占大头:一个页面几十行文字里,只有一两句是该页独有的。
  • 聚合输出:标签页、列表页、筛选结果页,把同一批条目换一下顺序输出。
  • 参数变体:排序、分页、跟踪参数指向同一批内容。
  • 多规格共用描述:不同型号、颜色、版本的产品页,除了字段值不一样,描述文字完全一致。
  • 跨栏目或跨站同步:同一份内容推到多个栏目或多个站点,没有做本地化改写。

可以用几个指标做对照

  1. 独有正文占整页可见文字的比例。比例越低,这一页越依赖模板支撑。
  2. 标题、H1、首段是否几乎相同。首段相同往往比标题相同更值得注意。
  3. 结构化字段是否直接复用,比如描述、摘要、FAQ 全部照搬。
  4. 页面是否存在独有的信息:数据、时间、作者、地区、规格,或者独有的查询结果。
  5. 内链入口是否重复:同一批页面互相链接的方式是否一模一样。

抓取、收录和「重复」不是同一件事

一个地址被抓取,说明它能被访问到;被索引,说明系统认为它有独立价值;被展示,还要再经过一层筛选。重复内容常见的表现是:地址被抓取了,但索引里只保留其中一个版本,其余的要么合并,要么不出现。所以「抓了很多、收录很少」不一定是入口问题,也可能是这批地址本身在互相稀释。

反过来,一个页面重复度不低,但它是这个主题下唯一的入口,也可能被保留。判断时不要只看重复度,还要看它有没有独立的用途。

处理顺序

  1. 先确认是否真的重复,把模板部分排除后再比较。
  2. 决定保留哪一版,通常保留内容最完整、更新最及时、内链最多的那一版。
  3. 合并,而不是只加标签。把独有信息补充到目标页,把入口指向目标页。
  4. 对确实没有必要的变体(排序、跟踪参数、空白筛选结果)做收口。
  5. 修正站内链接和站点地图,让入口和保留版本一致。
  6. 过一段时间再看索引和抓取日志,观察变体地址是否减少。
规范化标签表达的是偏好,不是删除指令。目标页本身内容单薄,加多少标签也不会让它变得独特。

几个容易做错的地方

  • 把所有列表页都指向一个并不存在的「综合页」。
  • 为了制造差异,在相同内容里替换同义词、调换段落顺序。
  • 分页全部指向第一页,导致后面的条目失去入口。
  • 只处理了新页面,旧的内链和站点地图还指向被放弃的版本。
  • 判断只看地址相似度,不看页面实际输出的内容。

重复判断的落点始终是内容本身。把每个页面单独能提供的东西写清楚,重复的部分自然就少了;反之,只靠标签和参数清理,问题往往只是换个地方再出现一次。