網站收錄

站内几篇内容很像:收錄阶段會怎么收敛,先做哪几步

站内寫了几篇主题相近、正文有重合的文章,過段時間發現只收了一两篇,或者收的不是主推那篇。這不是搜尋引擎漏了,而是它在做收敛和選擇。本文讲清相似頁面在收錄环节會怎么處理、该合並還是该保留,以及處理顺序和常见坑。

網站收錄

站内几篇内容很像:收錄阶段會怎么收敛,先做哪几步

站内寫了几篇主题相近的文章,URL 不同、标题不同,但正文有大段重合。過一段時間查索引,發現只收了一两篇,或者收下的那篇並不是你想主推的。這通常不是搜尋引擎漏了,而是它在做收敛和選擇。

先分清是哪種“像”

笼统说“重复内容”没什么意义,處理方式的差別很大。可以先分成四類看。

  • 完全重复:采集、镜像、带參數的同一頁面,正文几乎一字不差。
  • 主体相同、外壳不同:同一篇内容出現在两個栏目,模板、面包屑、推荐位不一样。
  • 主题相近但各有侧重:系列文章的上下篇,或者從不同角度解讀同一件事。
  • 列表頁與詳情頁:聚合頁把几篇文章摘要拼在一起,和原文重合度很高。

收錄阶段實际會發生什么

這几類頁面通常都會被蜘蛛抓到,抓取的门槛並不高,内鏈和 sitemap 都能把它們交出去。真正出現分化的是索引环节。

搜尋引擎會判断這一组 URL 是不是在讲同一件事。如果是,它倾向于選一個代表放進索引,其余的要么不進,要么進去之後長期得不到展示机會。選谁没有公開公式,通常參考這几方面:

  • 哪個 URL 更早被發現、站内有更多連結指向它;
  • 哪個頁面正文更完整、更贴近搜尋意图;
  • canonical、sitemap、内鏈锚文本给出的信号是否一致;
  • 站内结构上谁更像“正式入口”。
被抓到不等于被索引,被索引也不等于被選中展示。相似頁面的問题,更多出在“選擇”這一步,而不是“發現”這一步。

该合並還是该分開

判断标准不是文字重复率,而是搜尋意图。

  • 两篇回答的是同一個問题、面向同一批搜尋词,讀者看完任意一篇就够了,更适合合並,留一個主 URL,另一個做 301。
  • 两篇分別解决不同問题,只是共享了背景段落,可以都留,但要把重合的正文压下去,让各自的獨立内容成為主体。
  • 同一内容确實需要多個入口(不同栏目、不同设备),可以用 canonical 指向主版本,前提是内容真的相同。

建议的處理顺序

  1. 先把候選 URL 列出来,记錄各自的正文主体(去掉導航、推荐、评论後的部分)和主要内鏈来源。
  2. 判断搜尋意图是否重合。重合度高、單獨看没有獨立價值的,考虑合並。
  3. 合並时優先選已经有外鏈、有内鏈、被抓更频繁的那個 URL 作為保留版本,其余 301 過去。
  4. 需要都保留的,改寫重合段落,补上各自獨有的部分,不要只改标题和開头。
  5. canonical 只用在真正相同的頁面上,別用它把内容不同的頁面硬指到一處。
  6. 改完更新 sitemap 和内鏈,让站内連結尽量指向保留版本。

几個常见的坑

  • 只改标题和描述,正文照舊,搜尋引擎看到的還是同一份内容。
  • 用 canonical 指向一個内容明顯不同的頁面,声明和實际不一致,容易失效。
  • 一次性给一批頁面加 noindex,其中有些本来能带来流量,動手前先看資料。
  • 合並後舊 URL 直接返回 404,没有 301,已有的連結和權重都断了。

改完怎么观察

不要指望当天就有變化。合並和收敛需要等搜尋引擎重新抓取、重新评估,几周到几個月都算正常。

可以關注這些信号:保留版本的抓取频率有没有上升、索引里那几個重复 URL 是否逐渐减少、站内搜尋或外鏈是否仍指向舊地址(需要补 301)。如果只是“收錄數量變少”,但保留版本表現稳定,這往往就是预期结果。

相似頁面本身不算错誤,問题在于同一件事被拆成很多 URL,却始终没有明确的主次。先把主次關系理顺,比反复提交 sitemap 更有用。