很多站点在做收錄核對时,注意力都放在外鏈、蜘蛛日誌、sitemap 上,却容易跳過一個問题:同一篇内容在站内出現了好几個 URL。栏目頁、专题頁、标簽頁、移動版、打印版、带參數的版本,這些地址各自都能正常打開,内容主体却差不多。等到真正去看索引时,往往發現里面躺着的是某個並不重要的版本,而想推的那個地址反而没進去。遇到這種情况,先別急着改模板,把站内重复的版本理清楚更要紧。
站内重复通常從哪来
- 編輯把同一篇稿子同时挂到多個栏目,每個栏目生成一個獨立 URL
- CMS 自動生成的标簽頁、聚合頁,把摘要连同正文一起輸出
- 专题頁把文章正文整段複製過来,只改了标题和头部
- 打印版、移動版、带跟踪參數的版本各有一套地址
- 舊栏目改版後内容迁移,老地址没有處理干净,和新地址並存
這些来源里,有些是模板设計带来的,有些是編輯习惯造成的。做核對时不用急着判断谁對谁错,先把「哪些 URL 装的是同一份内容」列出来。
重复内容會带来什么麻烦
面對多個内容相近的地址,搜尋引擎需要自己判断哪個是主版本。這個判断過程會占用抓取配額,也可能让原本集中的信号被分散到不同地址上。這不等于一定不收,但常见的结果是:索引里選中的版本和你的预期不一致,或者几個版本互相替換,收錄狀態来回摆動。對抓取预算有限的中小站点来说,這種消耗尤其不划算。
所以站内重复更像是一個版本管理問题,而不是内容质量問题。核對的目标是让同一份内容只有一個明确的代表地址。
收錄核對时按這几步走
- 抽样:從每個栏目、每種模板各取三到五個地址,看索引里留下的是哪個版本,记下它的来源
- 分组:把内容主体基本相同的地址归到一组,标注每個地址由哪套模板生成
- 定主版本:每组只保留一個對外主地址,通常選信息最全、更新最及时、内鏈最多的那個
- 處理非主版本:能用 canonical 的指回主版本;纯重复又没有獨立價值的用 301 到主版本;需要保留但不希望進索引的(打印版、參數版等)用 noindex 或 robots 規則挡掉
- 复查内鏈:把站内指向非主版本的連結改成指向主版本,別让入口繼續分散
- 观察:改完当天不要下结论,给抓取和重新判断留出時間,過一段時間再看索引里留下的版本是否稳定
定主版本时的几個判断点
- 正文是否完整,有没有被截断或只留摘要
- 更新是否及时,頁面上的時間信号是否可信
- 站内是否有足够的内鏈指向它,是不是孤岛
- URL 是否干净稳定,不依赖一長串參數
哪些情况不必强行合並
如果两個頁面的目标關鍵詞、内容侧重确實不同,只是部分段落重合,那未必算重复。硬合並反而會丢掉原本的流量入口。判断标准可以简單一点:用戶同时看到這两個頁面,會不會觉得就是同一篇東西。會,才按重复處理。
處理完還要回到收錄核對本身
理清重复内容,解决的是「该收哪個版本」,不是「一定收多少」。做完之後仍然要回到抓取日誌、狀態碼、sitemap 這些基础項上,確認主版本能被正常抓取、能正常返回内容。主版本定得再清楚,如果蜘蛛拿到的是一張空壳或者一個错誤碼,前面的整理也落不了地。
站内重复不是先改模板就能解决的,先把同一份内容的主版本定下来,再谈收錄核對的其他环节。