站点运营

站点运营:多語言站点的 hreflang 自查,让蜘蛛分清每個語言版本

多語言或多地区站点常常卡在标注环节:頁面互相不指向、canonical 统一指回主語言、語言切換器只靠 JS 跳轉,都會让蜘蛛分不清版本關系。本文從结构選擇、hreflang 規則、内容本地化、sitemap 配合到上线後的自查清單,梳理一套可执行的运营检查思路。

站点运营

站点运营:多語言站点的 hreflang 自查,让蜘蛛分清每個語言版本

做多語言或多地区站点时,最容易出問题的地方往往不是翻译质量,而是“蜘蛛能不能分清這些頁面是什么關系”。同一個頁面存在英文、日文、繁体版本,如果没有明确的互相声明,搜尋引擎很可能只挑一個版本收錄,其余版本要么被当成重复内容,要么長期不被抓取。

先定结构,再谈标注

多語言站点的常见做法有三種:主域名下開子目錄(example.com/en/)、使用子域名(en.example.com)、使用獨立域名。三種都能用,但运营层面要考虑维護成本:子目錄最容易统一後台和權重,子域名和獨立域名更适合业務獨立、团队分開的情况。不管選哪種,上线後尽量不要频繁更換,換结构意味着大量跳轉和重新建立信任。

hreflang 的三條基本規則

1. 双向互指

A 頁面标注了 B 頁面,B 頁面也要标注 A 頁面,並且每個頁面都要包含指向自己的一條。單向标注基本等于没标。

2. 語言與地区分開寫

zh-Hans、zh-Hant 用来区分简繁,en-GB 與 en-US 用来区分地区。只寫語言不寫地区,在英美等地区差异明顯的内容上會顯得模糊,蜘蛛也难以判断该给谁看。

3. 別忘 x-default

x-default 指向語言選擇頁或預設版本,用于新訪客没有明确語言偏好时。它不是必填項,但多語言站点建议保留,否則容易出現“預設跳哪里”的混乱。

内容层面:每個版本都要有存在理由

  • 不要用机器翻译直接铺開十几個语種,缺乏實质内容的空壳頁面會拖累整站的质量判断。
  • 價格、货幣、联系方式、法規說明等本地化信息,要跟語言版本同步更新,別只翻译正文。
  • 各語言版本之間的互鏈,尽量用普通 a 标簽寫在頁面里,別只放在依赖 JS 的下拉菜單中。

站点地图與内鏈的配合

在 sitemap 中用 xhtml:link 标注各語言地址,能让發現更快,但站点地图只是补充,頁面上的 hreflang 才是主要依據。語言切換器建议輸出可抓取的連結,直接落地到對應 URL,而不是先靠 cookie 记住語言再跳轉,否則蜘蛛看到的可能永遠只有一個版本。

自查时可以先抓取一個小语種的頁面,看源代碼里的 hreflang 是否完整、是否指向真實可訪問的地址、是否存在指向已下线頁面的死标注。

上线後的定期自查清單

  1. 抽查 5 到 10 個頁面的 hreflang,確認双向互指、無 404、無多余跳轉鏈。
  2. 確認各語言版本的 canonical 指向自己,而不是统一指回主語言頁面。
  3. 检查語言切換器是否輸出真實連結,移動端是否同样可见。
  4. 检查 sitemap 是否覆盖所有語言版本,且没有混入已停用的语種地址。
  5. 翻一翻服務器日誌里各语種子目錄的蜘蛛抓取量,長期為 0 的目錄要排查原因。

多語言站点的运营难点在于“一致性”:结构一致、标注一致、更新节奏一致。把這几件事稳定下来,蜘蛛更有可能把各版本当成一组互相补充的頁面,而不是互相竞争的重复内容。