網站收錄

多語言與多地区站点的收錄:語言目錄、hreflang 與重复内容治理

同一套内容拆成多個語言或地区版本後,索引里常出現只收錄一版、多版互相抢词、URL 反复切換的情况。本文從版本關系、語言目錄規划、hreflang 的作用邊界、重复内容触發点和自检顺序几方面,說明多語言站点该怎样把關系寫清楚,让收錄更稳定。

網站收錄

多語言與多地区站点的收錄:語言目錄、hreflang 與重复内容治理

同一個站点做出多個語言或地区版本之後,索引里常见的現象是:只收錄了其中一版,或者几版同时出現却在互相抢词,甚至同一個頁面在索引中反复切換地址。問题往往不在翻译质量,而在于版本關系没有在 URL 和信号层面说清楚。

先分清三種版本關系

  • 翻译版:同一主题、不同語言,内容對應但不完全等同,例如中文頁與英文頁。
  • 地区變体:同一語言、面向不同地区,例如 en-US 與 en-GB,正文可能大部分相同,差別在货幣、地址、配送范围。
  • 切換變体:僅靠參數、cookie 或脚本切換語言,地址基本不變。

前两種适合各自拥有獨立 URL,第三種對搜尋最不友好,因為它让爬虫只看到一個地址、一份内容。判断时可以先問一句:關掉 cookie、不点任何按钮,直接輸入地址能不能拿到這個語言版本?能,才算獨立頁面。

語言目錄怎么規划

常见做法是用子目錄,例如 /en/、/zh-cn/,把語言和地区寫進路径。子域名與獨立域名同样可行,只是要額外處理權重分配和配置成本。不建议把語言塞進參數,因為參數地址容易被折叠、被忽略,也不利于在 sitemap 里区分。

路径命名上保持稳定就好,不必频繁更換。真正影响收錄的是地址是否唯一、是否可直達,而不是用了哪種寫法。

hreflang 解决的是归属,不是收錄

不少人以為加了 hreflang 就會收錄所有語言版本,實际上它主要說明這些頁面是同一主题的不同語言版本,請把對應版本展示给對應地区的用戶。它不保證抓取,也不保證索引。頁面仍要能被爬到、正常返回 200、有不依赖脚本就能讀到的正文。

hreflang 是注释,不是收錄開關。注释寫错,反而會让搜尋引擎判定版本關系混乱。

重复内容的几個触發点

  • 語言切換只改 cookie,地址不變,多個版本實际只存在一個地址。
  • 按 IP 或浏览器語言自動跳轉,且跳轉目标固定在首頁級地址,爬虫拿不到其他語言版本。
  • 机翻版本未做本地化,正文與原文逐句對應,容易被判為重复。
  • 地区變体正文完全一致,只差一個邮编或电话,缺少實质差异。
  • 同一語言既有 /en/ 又有 /en-us/,两邊内容相同且互相没有声明關系。

遇到這些情况,不必急着删頁面。先判断哪些版本對用戶确有必要,有價值的保留並补足本地化内容,重复度高的再考虑合並或加規范地址声明。

自检與處理顺序

  1. 確認每個語言版本都有稳定且獨立的地址,直接訪問返回 200,内容不依赖 cookie 或脚本才出現。
  2. 检查互相引用的 hreflang 是否成對、是否自引用、地区碼寫法是否規范。
  3. 逐版對比正文,找出差异极小的頁面,决定补充内容還是合並處理。
  4. 確認 sitemap 是否按語言分開提交,每個文件只放该語言的地址。
  5. 最後再回看索引报告,区分是抓取問题、渲染問题,還是重复内容問题。

容易忽略的细节

  • 語言切換入口用可点击的連結,不要只做成脚本下拉框。
  • x-default 指向哪一版要有明确選擇,通常是内容最完整或覆盖面最广的那一版。
  • 自動跳轉尽量改成提示式横幅,让用戶和爬虫都有選擇的余地。
  • 不同語言的頁面之間,正文里的内鏈也要指向對應語言版本,不要一律指向主語言。

多語言站点的收錄問题,本质是把版本關系寫清楚:地址獨立、關系声明准确、内容有實际差別。做到這几点,索引里出現多版争抢或频繁切換的概率會明顯下降,後續排查也有明确的入手点。