網站收錄

多語言和地区版本頁面:收錄时是按一個頁面還是几個頁面算

做多語言或分地区站点时,同一個产品往往有英文頁、中文頁、日文頁。本文說明搜尋引擎為什么把每個語言版本当成獨立 URL 分別處理,hreflang 能做什么、不能做什么,自動跳轉带来的抓取偏差,以及一套可落地的多語言站点收錄排查顺序。

網站收錄

多語言和地区版本頁面:收錄时是按一個頁面還是几個頁面算

做多語言或分地区站点的人常會遇到一個疑問:同一個产品的英文頁、中文頁、日文頁,到底是算一個頁面的几個版本,還是三個各自獨立的頁面?從抓取和索引的角度看,结论偏向後者——搜尋引擎會把每個語言、每個地区的 URL 当成獨立頁面来對待。

每個語言版本都是獨立 URL,索引也各算各的

只要 URL 不同,搜尋引擎看到的就是不同的资源。它們各自有獨立的抓取记錄、索引狀態和覆盖报告條目。也就是说,英文頁被收錄,並不代表日文頁也會被收錄;英文頁從索引里掉出去,也不會自動影响中文頁。這一点在實际运营中经常被忽略,很多人發現某個語言版本没進索引时,會去检查整個站点的整体狀態,實际上只要盯住這個語言目錄下的 URL 就够了。

hreflang 不负责收錄,只负责“配對”

hreflang 的作用是告诉搜尋引擎:這几個 URL 是同一内容的不同語言或地区版本,請在對應語言或地区的搜尋结果里優先展示匹配的那一個。它不會让頁面更容易被收錄,也不會把几個版本合並成一條索引记錄。它解决的是一组頁面之間的對應關系,而不是收錄與否的問题。常见的配置要点有這些:

  • 必须双向互指。A 頁指向 B 頁,B 頁也要指回 A 頁,單方面声明往往會被忽略。
  • 語言代碼和地区代碼要寫規范,例如 zh-Hans、en-US,不要用自行發明的简寫。
  • 如果整组頁面有明确的預設版本,可以用 x-default 标注兜底版本。
  • hreflang 指向的 URL 必须能正常訪問,指向 404、跳轉頁或已被屏蔽的地址都會让整组配對失效。

只配 hreflang,不解决内容重复

有些站点把 hreflang 寫得非常完整,但几個語言版本的正文其實是同一段文字。這種情况下,索引里往往只會保留其中一條,其他版本被当作重复内容處理。配對标簽說明的是“關系”,不會改變“内容是否雷同”這個事實。

自動跳轉和語言猜测带来的抓取偏差

不少站点用 IP 归属地或浏览器語言自動跳轉到對應版本。這對真實用戶是友好的,但對蜘蛛不太友好:蜘蛛通常從固定的出口 IP 抓取,容易永遠只看到某一種語言,其余語言的 URL 可能長期停在“已發現但未抓取”的狀態。

相對稳妥的做法是,让預設語言版本可以直接訪問,其他語言版本通過頁面上明顯的切換入口進入;如果确實需要跳轉,也建议在頁面上保留指向所有語言版本的普通連結,让蜘蛛有路径走完全部版本。

机器翻译和内容雷同的版本容易被判重复

有的站点為了凑語言數量,把英文正文原样搬到中文頁,只改了标题和導航。這類頁面即便被抓取,也常常拿不到稳定的索引位置。判断标准其實很简單:換一個語言的用戶打開這個頁面,能不能讀到用该語言寫的、獨立成篇的内容。如果只是同一段话的机械替換,收錄效果通常不會理想。

检查多語言站点收錄时的几個步骤

  1. 在索引覆盖报告里按語言目錄(如 /en/、/de/、/ja/)分別看收錄數量,找出明顯偏低的目錄。
  2. 確認每種語言是否落在清晰的子目錄或子域名下,避免同一語言散落在多個無規律的路径里。
  3. 抽查几组頁面的 hreflang,確認双向指向、無死鏈、無指向被屏蔽的地址。
  4. 看服務器日誌里各語言目錄的抓取频次,判断是否存在只抓預設語言、其余版本長期無人問津的情况。
  5. 抽样對比各語言版本的正文,检查是否存在翻译没做完、只剩模板内容的情况。

關于用工具“催收錄”的一個提醒

有人會想到用蜘蛛池之類的工具去推動多語言頁面被訪問。需要分清的是,這類工具能增加 URL 被發現和被請求的概率,属于抓取环节的事;但如果頁面本身没有獨立内容、配對關系混乱、站点整体质量不高,抓取之後依然可能停在“已抓取但未编入索引”。發現、抓取、索引是三道不同的關卡,工具能影响的主要是前一道半。

多語言站点的收錄問题,核心往往不是“蜘蛛来得够不够多”,而是每個語言版本有没有獨立價值、版本之間的對應關系是否清楚、訪問方式有没有互相打架。