網站收錄

同一内容出現多個 URL:先把地址收敛,再谈收錄

很多收錄問题的根源不是頁面质量,而是同一份内容被拆成了多個可訪問地址。本文梳理重复地址的常见来源、對抓取與索引的實际影响,以及确定主地址、重定向、canonical 與统一入口的落地顺序,帮助你把索引资源集中到真正需要收錄的頁面上。

網站收錄

同一内容出現多個 URL:先把地址收敛,再谈收錄

做收錄排查时,很多人一上来就問“為什么這個頁面没收錄”,但更常见的情况是:頁面其實早就被發現了,只是同一份内容被拆成了好几個地址,搜尋引擎把它們当成不同頁面分別處理,内鏈、外鏈和抓取次數都被分散掉。地址不收敛,後面再谈收錄节奏,往往事倍功半。

哪些情况會制造出重复地址

同一個頁面存在多個可訪問 URL,通常来自這几處:

  • 协议與域名寫法:http 與 https、带 www 與不带 www 同时可訪問。
  • 路径细节:末尾斜杠的有無、路径大小寫、多余的 index.html 或 index.php。
  • 參數寫法:同一组篩選條件,參數顺序不同,或带上了 utm、来源标记等追踪參數。
  • 站内自身产生的地址:排序、翻頁、會话 ID 带来的临时連結。
  • 技術出口:打印版、AMP 版、移動版使用了獨立域名或獨立路径。

這些地址大多能正常打開,返回 200,站内也真的存在入口連結。對用戶来说没有差別,對抓取和索引来说却是好几份待處理的任務。

地址重复带来的實际影响

  • 抓取次數被摊薄:同一份内容被反复抓取,留给新頁面的額度就少了。
  • 收錄信号被拆分:内鏈、外鏈、点击分散到多個地址,單個地址更难被判定為值得收錄。
  • 索引结果不稳定:搜尋引擎可能在不同時間選不同地址作為代表,搜尋结果里看到的 URL 會来回跳動。
  • 資料統計失真:收錄量、流量看着不少,實际頁面數遠没有這么多。

收敛地址的四個動作

  1. 确定主地址:先决定每個頁面唯一對外使用的形式,包括域名寫法、是否带斜杠、參數規則。這個規則要寫下来,避免不同人做出不同结果。
  2. 用 301 把舊地址指向主地址:能重定向的優先重定向,它比 canonical 更明确。注意別做成鏈式跳轉,也別跳回原地址。
  3. 用 canonical 声明規范頁:無法重定向的情况,例如參數頁仍需保留可用性,可以用 canonical 标注。canonical 是建议而非强制,所以不要在頁面上同时给出互相矛盾的信号。
  4. 统一入口:内鏈、站点地图、分享連結、结构化資料里的 URL 都用主地址。如果内鏈還在指向舊地址,等于自己持續制造重复。

參數類地址怎么取舍

並不是所有带參數的 URL 都要收敛。判断标准是:這個參數是否真的改變頁面主体内容。

  • 追踪參數不改變内容,應剔除。可以在服務器层面忽略這些參數,或统一重定向到無參地址。
  • 排序參數通常只改變顺序,内容集合相同,建议保留一個預設排序供抓取,其余标注 canonical 指向預設頁。
  • 篩選參數如果组合出的结果頁有獨立搜尋需求,且能稳定产出内容,可以保留一部分;如果只是把同一批内容換個顺序,就不必让它們各自進入索引。

動手前的自查清單

  1. 随机取十個已收錄 URL,看是否存在只差大小寫、斜杠或參數顺序的孪生地址。
  2. 检查站点地图里是否混入了非主地址。
  3. 检查站内連結是否還在使用舊寫法。
  4. 把 canonical 與重定向對照,確認两者指向的是同一個地址。
  5. 改完後過一段時間回看,確認索引里選用的代表地址是否趋于一致。
地址收敛不會立刻带来收錄量上涨,但它是把抓取和索引资源用在真正需要收錄的頁面上的前提。先把同一份内容合並成一個地址,再去看收錄資料的變化,判断才有意义。