很多人把重复内容理解成“別人抄我”,但在收錄层面,很大一部分重复来自站点自己:同一段模板文字出現在几千個頁面上,同一篇内容被列表頁、标簽頁、归档頁反复呈現。搜尋引擎最终要做的是選一個版本留下来,其余的要么被归並,要么抓取優先級被压缩。理解這一点,比反复提交 URL 更有用。
先分清三種站内重复
一、模板造成的重复
当正文只有两三百字,而導航、侧栏、推荐位、頁脚免责声明加起来上千字时,頁面在特征上更接近模板而不是内容。多個這類頁面放在一起,机器很难判断谁更有代表性。
二、集合頁與正文頁的重复
标簽頁、分類頁、归档頁、站内搜尋结果頁,往往把正文的标题和摘要原样罗列。如果集合頁没有額外的編輯内容,它和正文頁的差异可能只剩排版和内鏈。
三、跨頁复用
同一篇内容發在两個栏目、多語言版本、打印版、AMP 版、带參數的分頁地址,都属于同一份内容的多個出口。這些地址各自被收錄,等于把同一份價值拆成了几份。
先判断哪些该處理
不是所有相似頁面都需要動手。可以看三個信号:
- 服務器日誌里,集合頁被抓取的次數遠高于正文頁,正文頁長期排在队列後面;
- 在搜尋结果中,用戶落地的是列表頁而不是正文頁,打開後缺少實质内容;
- 站点被索引的 URL 數量在涨,但真正有獨立信息量的頁面没有增加。
出現其中一两條,再考虑收口;如果正文頁抓取正常、展示正常,不必為了“看起来干净”大動干戈。
處理顺序:從判断到取舍
- 先看正文占比。把模板部分去掉,頁面還剩多少獨立信息。剩下太少,說明這個地址本身價值有限,先別急着让它進索引。
- 再看集合頁有没有獨立價值。有編輯導语、有篩選說明、有排序逻辑的列表頁,是可以被收錄的;只有标题加摘要的,價值主要在内鏈而不在收錄。
- 确定唯一代表版本。同一份内容的多個出口,選一個作為主版本,其他版本用 canonical 指過去。canonical 是建议而非强制,主版本本身必须可抓取、内容完整。
- 對無獨立價值的集合頁用 noindex, follow。頁面不進索引,但其中的連結仍可被跟随,正文頁的内鏈不會因此断掉。
- 慎用 robots.txt 屏蔽。被 robots 拦住的地址,抓取工具看不到頁面上的 noindex 和 canonical,連結關系也會一起丢失,容易出現“已屏蔽但索引里還有”的情况。
- 跨頁复用優先用 canonical,而不是複製全文。多栏目發布同一篇内容时,保留一處全文、另一處做摘要並指向主版本,比粘贴两遍更稳妥。
容易踩的几個坑
- 把“重复内容”当成惩罚。多數情况下是归並與擇優,頁面不會被處罚,但两個版本也很难同时获得展示。
- 把标簽頁、归档頁一刀切 noindex,顺手也切掉了站内最重要的一批入口連結。
- 摘要長度、标题措辞有差异就以為不算重复。判断依據是主要内容特征,不是字數差。
- 只改一處,比如只加 canonical,却让分頁、參數、打印版繼續各自生成。
改完之後看什么
調整完成後,观察顺序建议是:先看日誌里抓取請求是否向正文頁倾斜,再看索引里留下的版本是不是你指定的那一個,最後才看搜尋结果的落地頁是否換成了正文。抓取层面的變化可能几天内就能看到,索引层面的替換通常需要更長時間,中間出現新舊版本交替属于正常現象。
重复内容處理的目标不是让站点“看起来很干净”,而是让抓取预算和收錄名額尽量落在有獨立信息量的頁面上。收口之後仍需持續观察,別把一次調整当成终点。