網站收錄

多語言與多地区站点:收錄混乱时先理清語言版本與 URL 的對應關系

多語言站点在收錄上出問题,多半不是内容质量,而是語言版本與 URL 的對應關系没理顺。本文讲清子目錄、子域、獨立域名三種结构的取舍,hreflang 與 canonical 各自的分工,以及一套可以照着走的自查顺序。

網站收錄

多語言與多地区站点:收錄混乱时先理清語言版本與 URL 的對應關系

一個产品同时有中文、英文、日文頁面时,搜尋引擎要判断的不只是内容质量,還有這几件事:哪几個 URL 属于同一份内容的不同語言版本、每個版本面向哪類用戶、主版本是谁。這几件事没理顺,常见的结果是不同語言版本抢同一批查询,或者只有其中一两個版本被收錄,其余長期停在索引之外。

第一步:确定 URL 的對應關系

多語言站点的 URL 结构一般有三種做法,各有取舍,先選定再谈收錄。

  • 子目錄:example.com/cn/、example.com/en/。權重集中在一個域名,维護成本低,适合大多數中小站点。
  • 子域名:cn.example.com、en.example.com。可以分開部署和运营,但主域與子域之間需要額外的關联信号。
  • 獨立域名:example.cn、example.com。地区隔离彻底,适合本地化运营差异很大的情况,代價是權重分散、维護成本高。

结构一旦上线,尽量不要中途大改。改结构意味着所有外鏈、内鏈、跳轉、hreflang 标注都要同步調整,調整期間收錄波動是正常的。

hreflang 解决的是指向,不是收錄

hreflang 用来声明几個 URL 是同一内容的不同語言或地区版本,帮助搜尋引擎把正确版本展示给對應用戶。它不會让一個没被收錄的頁面進入索引,也不會阻止重复内容判定。常见寫法問题有這些:

  • 單向标注:A 指向 B,B 没指回 A。這種信号通常會被忽略,必须双向回指。
  • 指向不可訪問的 URL:目标被 robots.txt 挡住、被 noindex、或者返回 404,标注就失去意义。
  • 語言與地区碼寫得不規范:用 zh-Hans-CN、en-US 這類标准寫法,避免只寫 zh、en 却想表達地区差异。
  • x-default 缺失或指错:需要有一個預設版本承接没有匹配語言的用戶,通常指向主語言或國际版。

canonical 與 hreflang 各管一段

這两者容易混用。hreflang 表達的是平行關系,几個版本同时存在、各自有效;canonical 表達的是归並關系,告诉搜尋引擎這几個 URL 里只保留一個。多語言版本之間通常不應该用 canonical 互指,那是把其他語言版本主動合並掉了。canonical 在這里的用途,是處理同一語言内部的重复,比如带參數的篩選頁指向干净版本。

如果發現某個語言版本一直不收錄,先检查是不是被同站点其他版本的 canonical 或跳轉指向吞掉了,而不是急着去加新的提交渠道。

一套可以照着走的自查顺序

  1. 逐個訪問各語言版本,確認都能直接打開,没有多余跳轉鏈。
  2. 检查 hreflang 是否双向、是否指向真實可訪問的 URL。
  3. 核對 canonical,確認没有把其他語言版本誤指到主語言頁面。
  4. 看服務器日誌里各語言版本的抓取频率,差异過大往往說明發現环节有問题。
  5. 用站内查询粗略看各版本的收錄分布,再回头看内鏈是否只指向了其中一两個版本。

容易被忽略的几点

  • 語言切換按钮如果只用 JS 跳轉、没有真實連結,蜘蛛很难顺着它走到其他版本,内鏈要给出可抓取的 a 标簽。
  • 机翻内容若與已有版本高度重合,质量判定上會被压低,补充本地化信息比堆語言版本數量更實际。
  • 各地区站点如果共用同一套模板和同一批商品描述,重复内容問题會比單語言站点更明顯。

多語言站点的收錄問题,多數能在 URL 與标注层面找到原因。先把结构定清楚、把指向關系标注正确,再去看抓取和索引資料,比反复提交 URL 更有效。