判断重复,最先要做的不是打開工具,而是把「這一頁獨有的内容」和「每個頁面都有的部分」分開。分開之後,很多看起来重复的頁面其實不重复,很多看起来不同的頁面其實是同一份内容換了排版。
第一步:划定正文主体的邊界
導航栏、面包屑、頁脚、侧邊推荐位、版權信息,這些属于模板。它們在所有頁面都出現,不參與重复判断,但會稀释正文占比。可以把頁面文字複製出来,去掉這些块,剩下的才是需要比較的部分。JavaScript 渲染的頁面要注意:直接取 HTML 源碼可能拿不到主体内容,需要看渲染後的结果。
重复的几種常见形態
- 模板占大头:一個頁面几十行文字里,只有一两句是该頁獨有的。
- 聚合輸出:标簽頁、列表頁、篩選结果頁,把同一批條目換一下顺序輸出。
- 參數變体:排序、分頁、跟踪參數指向同一批内容。
- 多規格共用描述:不同型号、颜色、版本的产品頁,除了字段值不一样,描述文字完全一致。
- 跨栏目或跨站同步:同一份内容推到多個栏目或多個站点,没有做本地化改寫。
可以用几個指标做對照
- 獨有正文占整頁可见文字的比例。比例越低,這一頁越依赖模板支撑。
- 标题、H1、首段是否几乎相同。首段相同往往比标题相同更值得注意。
- 结构化字段是否直接复用,比如描述、摘要、FAQ 全部照搬。
- 頁面是否存在獨有的信息:資料、時間、作者、地区、規格,或者獨有的查询结果。
- 内鏈入口是否重复:同一批頁面互相連結的方式是否一模一样。
抓取、收錄和「重复」不是同一件事
一個地址被抓取,說明它能被訪問到;被索引,說明系統認為它有獨立價值;被展示,還要再经過一层篩選。重复内容常见的表現是:地址被抓取了,但索引里只保留其中一個版本,其余的要么合並,要么不出現。所以「抓了很多、收錄很少」不一定是入口問题,也可能是這批地址本身在互相稀释。
反過来,一個頁面重复度不低,但它是這個主题下唯一的入口,也可能被保留。判断时不要只看重复度,還要看它有没有獨立的用途。
處理顺序
- 先確認是否真的重复,把模板部分排除後再比較。
- 决定保留哪一版,通常保留内容最完整、更新最及时、内鏈最多的那一版。
- 合並,而不是只加标簽。把獨有信息补充到目标頁,把入口指向目标頁。
- 對确實没有必要的變体(排序、跟踪參數、空白篩選结果)做收口。
- 修正站内連結和站点地图,让入口和保留版本一致。
- 過一段時間再看索引和抓取日誌,观察變体地址是否减少。
規范化标簽表達的是偏好,不是刪除指令。目标頁本身内容單薄,加多少标簽也不會让它變得獨特。
几個容易做错的地方
- 把所有列表頁都指向一個並不存在的「综合頁」。
- 為了制造差异,在相同内容里替換同义词、調換段落顺序。
- 分頁全部指向第一頁,導致後面的條目失去入口。
- 只處理了新頁面,舊的内鏈和站点地图還指向被放弃的版本。
- 判断只看地址相似度,不看頁面實际輸出的内容。
重复判断的落点始终是内容本身。把每個頁面單獨能提供的東西寫清楚,重复的部分自然就少了;反之,只靠标簽和參數清理,問题往往只是換個地方再出現一次。