網站收錄

多語言版本怎么收錄:hreflang、語言目錄與重复内容的關系

多語言站点常遇到同一内容對應多個地址、收錄归属不清的問题。本文從 URL 结构選擇、hreflang 标注、語言切換方式和翻译质量几個方面,說明怎样减少重复内容、让各語言版本被正确识別,並给出按目錄检查收錄狀態的實用方法。

網站收錄

多語言版本怎么收錄:hreflang、語言目錄與重复内容的關系

多語言、多地区站点在收錄上遇到的問题,往往不是蜘蛛没来,而是同一份内容對應了多個地址:搜尋引擎需要判断该把哪個版本放進索引,又该在哪個地区的搜尋结果里展示。把结构和信号理清楚,通常比反复提交 URL 更有效。

先确定一套稳定的 URL 结构

常见做法有三種,各有代價:

  • 子目錄:example.com/en/、example.com/de/。集中在同一域名下,内鏈和外部信号容易匯總,多數情况下最省心。
  • 子域名:en.example.com。适合各地区由不同团队、不同服務器维護的情况,但語言版本之間的關联需要額外维護。
  • 參數或 cookie 切換:如 ?lang=en,或按用戶地区自動切換。這類寫法最容易出問题,參數版本容易被当成重复内容,cookie 切換則让蜘蛛只能看到預設版本。

结构定下来之後就不要在語言之間反复調整。目錄一改,舊地址就需要重新被抓取、重新被判断,中間會有一段狀態不稳定的时期。

hreflang 是信号,不是開關

hreflang 的作用是告诉搜尋引擎這几個地址属于同一内容的不同語言或地区版本,它影响的是展示层的選擇,而不是收錄本身。几個容易出错的点:

  • 必须互相指認:每個語言版本都要列出包括自己在内的全部版本,只做單向标注等于没标。
  • 每個版本都要自引用,缺少自引用时這條關系鏈可能被整体忽略。
  • 需要預設版本时用 x-default,指向不限定語言的那一版,通常是語言選擇頁或英文版。
  • 标注的地址應当是可直接訪問的規范地址,不要指向被 robots.txt 屏蔽或需要登入的頁面。
hreflang 不會让一個本来没被索引的頁面進入索引,它只處理已经進索引的版本之間,谁该展示给谁的問题。

語言切換別用自動跳轉

根據浏览器語言或 IP 自動跳轉到對應版本,對用戶看似友好,對抓取却不太友好:蜘蛛通常從某個固定地区發起請求,看到的可能永遠是同一個版本,其他語言目錄更难被發現。同时不同地区用戶拿到的地址不同,也容易造成同一頁面出現多個入口。更稳妥的做法是預設語言固定在根目錄或明确的語言目錄,其他版本之間用可见連結互相连接,把切換變成用戶主動点击的一步。

翻译质量决定這一版值不值得進索引

同一主题的多語言版本如果只是机器翻译的粗稿,句式不通、術语前後不一致,很容易被判定為與原文高度相似的低價值頁面。结果常见的是原文收錄正常,其他語言版本長期停留在已抓取、尚未编入索引。几個可操作的判断标准:

  • 标题、描述和正文是否针對该語言重新组织,而不是逐句替換词匯。
  • 本地化的關鍵詞是否有實际搜尋需求,而不是直译出来的词。
  • 頁面上的货幣、單位、联系方式、服務時間是否與该地区一致。
  • 内鏈是否指向同語言目錄内的頁面,而不是全部指回預設語言。

如果某個語言只有零星几頁翻译,不妨先只保留一個語言版本,不要為了凑數量铺開大量薄頁面。

怎么检查各語言目錄的收錄情况

  1. 用 site:example.com/en/ 之類的限定查询,逐語言目錄看大致覆盖面,注意這只是抽样,不等于准确索引量。
  2. 在服務器日誌里按目錄前缀過滤,看蜘蛛對各語言目錄的抓取次數是否嚴重失衡。
  3. 在搜尋控制台按目錄建立分组,對比各語言版本的抓取、展示與点击趋势。
  4. 抽查几個語言版本的頁面,確認 hreflang 标簽完整、双向、地址可正常訪問。

收錄狀態會随内容质量和结构調整而變化,多語言站点尤其如此。把 URL 结构、語言之間的連結關系和 hreflang 标注固定下来,再按目錄持續观察,比每次發現問题就临时提交一批 URL 更接近長期解法。