網站收錄

多語言與多地区版本:收錄核對先確認各語言頁是否被当作獨立頁面

多語言與多地区版本常常一邊進索引、一邊不進,或者两個語言版本互相顶替。本文把頁面先分成翻译頁、地区變体和自動生成頁三類,再给出可直接訪問性、hreflang 双向回指、canonical 自指、内鏈與 sitemap 入口的核對顺序,帮助判断收錄差异来自配置問题還是内容质量。

網站收錄

多語言與多地区版本:收錄核對先確認各語言頁是否被当作獨立頁面

同一個商品、同一篇文章,在中文站、英文站、地区子站各有一套 URL 时,收錄情况经常是一邊進、一邊不進,或者两個語言版本互相顶替。這類問题很少是搜尋引擎偏心,多數是版本之間的對應關系没交代清楚。

先把頁面版本分成三類

核對之前先分類,不同類型的處理方式並不一样:

  • 人工翻译的對應頁:主题一致、語言不同,是 hreflang 的典型用途。
  • 地区變体:同一語言、不同地区的版本,比如英文美國站與英文英國站,差异可能只在货幣、地址、库存。
  • 机器翻译或自動生成的頁面:量大、质量參差,容易被判為低價值或重复,收錄往往最不稳定。

分不清這三類,後面的核對就會把“翻译頁没收錄”和“自動生成頁没收錄”混成一件事。

核對一:每個語言版本能不能被單獨打開

多語言站最容易出現的情况是語言只存在于前端切換逻辑里:同一個 URL 通過 Cookie 或 JavaScript 判断語言,英文内容實际由同一段代碼渲染。這时搜尋引擎抓到的可能永遠是預設語言那一版。

核對方式很直接:關掉 Cookie、訪問不带任何偏好設定的 URL,看返回的 HTML 首屏是不是目标語言。如果确實要依赖客戶端切換,至少保證每個語言有獨立且可直接訪問的 URL。

核對二:hreflang 是不是双向回指

hreflang 不是單方面声明,而是互相確認。A 頁面声明了 B,B 頁面也要声明 A,配對的信号才完整。常见的断鏈情况有:

  1. 只有主語言頁寫了 hreflang,其他語言頁没有寫。
  2. 回指鏈中缺席某個版本,比如三種語言只互相指了两種。
  3. x-default 指向了一個本身不被收錄的 URL。
  4. 声明的語言代碼和頁面實际語言不一致,比如标為 zh-CN 但頁面用的是 zh-TW 的用词。

核對时可以按語言版本列表逐一對照,重点看每個 URL 是否都出現在其他版本的声明里。

核對三:canonical 是否指向自己

多語言頁面的 canonical 通常需要自指,而不是全部指向主語言版本。如果英文頁的 canonical 指向中文頁,等于主動告诉搜尋引擎不要把英文頁当獨立版本處理,收錄自然起不来。除非确實只打算保留一個版本,否則不要跨語言做 canonical 合並。

跨語言用 canonical 合並,等于把其中一個版本直接排除在索引之外;跨語言互相指向,才是 hreflang 该做的事。两者混用是不少站点收錄異常的根源。

核對四:内鏈有没有给每種語言留入口

語言切換器如果只是按钮、連結寫在 JS 里,或者所有語言都指向同一個不带語言路径的地址,那些頁面就只能靠 sitemap 被發現。可以這样检查:

  • 每種語言在導航或頁脚有可点击的 a 标簽入口。
  • sitemap 分語言提交,而不是只提交預設語言。
  • 尽量不通過跳轉或中間頁進入多語言版本,减少一层抓取路径。

核對顺序建议

  1. 列出全部語言與地区版本,标注 URL 與内容類型。
  2. 逐個 URL 直接訪問,確認返回内容與声明語言一致。
  3. 检查 hreflang 的双向完整性與語言代碼。
  4. 检查 canonical 是否自指。
  5. 检查内鏈與 sitemap 是否覆盖所有版本。
  6. 最後再對比各語言在索引报表里的數量差异,判断属于收錄延迟、质量淘汰,還是配置問题。

多語言收錄問题的特点是配置错一處、影响一整组頁面。與其盯着單個 URL 反复改内容,不如先把版本對應關系理顺,再看哪些頁面确實需要补内容或者收敛處理。