網站收錄

多語言與多地区站点的收錄核對:語言 URL、hreflang 與索引狀態的顺序

多語言與多地区站点的收錄問题,常出在版本關系和入口上,而不是内容本身。本文按語言 URL 结构、切換入口可抓取、hreflang 自洽、机器翻译頁面取舍的顺序,梳理一套可执行的核對步骤,並列出 CDN 分語言返回等容易忽略的细节。

網站收錄

多語言與多地区站点的收錄核對:語言 URL、hreflang 與索引狀態的顺序

多語言、多地区站点在收錄上出問题,往往不是頁面内容不够好,而是同一批内容被拆成了几個互相竞争的版本,或者版本之間没能互相說明關系。搜尋引擎面對多個語言 URL 时,需要明确知道哪一個版本是给哪一類用戶看的;否則容易出現只收了一個語言版本、其他版本長期停留在“已發現未索引”,或者几個語言版本互相替代的情况。

一、先看清 URL 是怎么分語言的

核對之前先把 URL 结构列出来,常见三類:子目錄(/en/、/de/)、子域名(en.example.com)、獨立域名(example.de)。三類各有取舍,但核對时的重点一致:同一語言版本的 URL 是否稳定、是否唯一、是否能被内鏈和站点地图覆盖到。

  • 子目錄最容易繼承主域名權重,也最容易因為目錄配置错誤導致語言頁面 404 或重定向回預設語言。
  • 子域名和獨立域名要單獨確認抓取狀態,不要預設主域的抓取情况能代表它們。
  • 如果同时存在 /en/ 和 /en-US/ 這類区分,先確認两者是不同内容,還是同一内容的两個入口。

二、hreflang 的核對要点

hreflang 是版本關系的声明,不是收錄開關。它不會让頁面被收錄,但寫错會誤導搜尋引擎選擇版本。

  1. 每個語言版本都要有指向自身的 hreflang(自引用),漏掉自引用是最常见的错誤之一。
  2. 一组語言版本的 hreflang 必须互相對應,A 指向 B,B 也要指向 A。
  3. x-default 一般指向預設版本,且在同一组里只出現一次。
  4. hreflang 里的語言代碼要和 URL 的實际内容一致,不要把英文頁标成 de。
  5. 不要用 hreflang 代替 canonical,也不要让已经被 canonical 指向別處的頁面繼續声明 hreflang。

三、按“入口—版本—關系”的顺序核對

把核對拆成三步,比一上来就改标簽更有效。

1. 入口是否齐全

每個語言版本是否有獨立入口:語言切換器是否用可抓取的 a 标簽、站点地图是否包含各語言 URL、對應栏目頁之間是否互相連結。切換器如果用 JavaScript 動態寫入,需要確認渲染之後連結仍然能被抓到。

2. 版本是否自洽

逐語言检查标题、正文語言、结构化資料、canonical 是否都指向本語言版本的自身 URL。常见错誤是英文頁面 canonical 指向中文頁面,结果英文版本長期拿不到自己的索引。

3. 關系是否正确

用抓取日誌或索引报表抽样,確認 hreflang 声明涉及的 URL 全部返回 200,不存在指向已刪除頁面或重定向鏈的声明。

四、机器翻译與薄内容的取舍

把同一篇内容机翻成十几種語言,语义重复度高、正文薄,收錄表現通常不稳定。與其追求語言數量,不如先把主要市场的人工版本做扎實,其余版本再判断是否需要被索引;确實不需要的,可以用 noindex 或干脆不放出入口。反過来,也不要因為收錄慢就把有價值的小语種版本一並 noindex,先看它有没有獨立入口和像样的正文。

核對顺序建议固定下来:URL 结构 → 入口可抓取 → 版本自洽 → 關系声明 → 索引狀態。顺序颠倒时,很容易把标簽問题当成内容問题来改。

五、容易被忽略的几個细节

  • 語言切換器把目前語言也寫成連結,形成大量自我循环連結,影响不大但會干扰日誌判断。
  • 区域 URL(如 /de/ 與 /de-AT/)内容几乎相同却都放出入口,需要明确谁是主版本。
  • 站点地图按語言拆分後,只提交了主語言的那一份。
  • CDN 或邊缘节点按用戶地区返回不同語言内容,但 URL 不變,導致同一 URL 抓取时看到的内容不稳定。這種情况要先统一服務端返回策略,再谈收錄。

多語言站点的收錄問题往往不會一次清零。建议按語言分別记錄索引數量與抓取情况,改動之後观察一段時間,避免在版本關系還没理清时就反复調整标簽。