网站收录

多语言站点收录变乱:语言版本与地区版本的索引归属怎么理清

多语言站点的收录问题往往不是页面没被索引,而是多个语言版本在索引里混在一起。本文按“分清内容关系、固定URL写法、核对canonical与hreflang、检查跳转方式、决定是否收敛”的顺序,说明语言版本之间怎么划清索引归属。

网站收录

多语言站点收录变乱:语言版本与地区版本的索引归属怎么理清

多语言站点的收录问题,往往不是“没被索引”,而是多个语言版本在索引里混在一起:用户搜中文词,出来的却是英文页;某个语言版本长期不进索引;或者同一个页面同时存在 /en/ 和 ?lang=en 两种地址。这类问题很少是单一原因,通常是 URL 结构、语言标注和内容本身三件事没有对齐。

先分清:是语言不同,还是内容相同

处理之前要先分类。两个页面看起来不一样,但可能只是翻译,也可能是面向不同市场的独立内容。

  • 内容相同、只是语言不同:这是同一份内容的多语言版本,各有独立 URL,属于正常的多语言结构。
  • 内容相同、语言也相同:例如 ?lang=en 和 /en/ 指向同一批英文内容,这是重复,需要收敛到唯一地址。
  • 内容不同、面向地区不同:比如港版和台版的价格、库存不同,即使语言相同也应各自保留。

判断标准是:删掉其中一个版本,是否会有人找不到他需要的信息。会,就不要合并。

每个语言版本要有一个稳定且自指的 URL

多语言站点最容易出问题的地方是同一份内容有多种写法。常见的有:

  • 子目录:/en/、/zh/
  • 子域名:en.example.com
  • 参数:example.com/page?lang=en
  • 自动跳转:根据浏览器语言跳到某个版本

前三种都能被正常抓取,关键是要固定一种,不要混用。尤其是参数版本和子目录版本同时存在时,索引里很容易两个都出现。

每个语言版本的页面,canonical 应该指向自己。有些站点为了“集中权重”,把所有语言版本的 canonical 都指向默认语言版本,结果非默认语言页面被判定为重复,长期不进索引。多语言页面之间是翻译关系,不是重复关系,不需要用 canonical 互相合并。

hreflang 是提示,不是收录开关

hreflang 的作用是告诉搜索引擎“这些页面是同一内容的不同语言或地区版本”,它不保证收录,也不代替链接。使用时注意几点:

  • 要双向:A 指向 B,B 也要指向 A,单边标注通常会被忽略。
  • 要有 x-default:给没有匹配语言的用户一个落点,一般指向默认语言版本或语言选择页。
  • 地址要可访问:hreflang 指向的 URL 如果返回 404 或被 robots.txt 屏蔽,标注无效。
  • 不要指向跳转前的地址:如果某语言页会 302 跳到别处,hreflang 应指向最终地址。

hreflang 写错通常不会导致页面被惩罚,但会让多个语言版本在搜索结果的呈现变得不稳定。把它当成辅助信号,而不是解决收录问题的手段。

语言切换别用挡住蜘蛛的方式

用 IP 或浏览器语言自动跳转,是很多多语言站点收录混乱的源头。蜘蛛通常从单一地区发起抓取,如果它每次访问首页都被跳到英文版,其他语言版本就可能长期缺少抓取入口。

更稳妥的做法是:默认地址不要强制跳转,把语言选择做成页面上的链接;只在用户明确点击后再跳。如果必须自动跳转,至少保证每个语言版本都有自己的可访问 URL,并且能从 Sitemap 和其他页面链接过去。

按这个顺序整理

  1. 列出所有语言和地区版本,标出哪些是翻译关系、哪些是独立内容。
  2. 同一份内容只保留一个 URL 形式,其余用 301 指向规范地址。
  3. 核对每个页面的 canonical 是否自指,去掉指向其他语言版本的写法。
  4. 检查 hreflang 是否双向、是否有 x-default、地址是否可访问。
  5. 确认语言切换不会拦截蜘蛛,Sitemap 中包含所有语言版本。
  6. 整理后观察一段时间,看索引里各语言版本的分布是否与预期一致。

什么时候该收敛掉一个语言版本

如果某个语言版本的内容质量明显偏低,比如机器翻译且无人校对、信息量不足,它未必值得单独占一个索引位置。这时可以考虑:

  • 合并:把低质量版本 301 到质量更好的同语言版本,或合并到默认语言版本。
  • 暂时下线:如果还没准备好,用 noindex 或返回 404,比让它以残缺状态留在索引里更好。
  • 保持现状:如果该版本有真实用户、有本地化内容,即使流量小也应保留。
多语言收录的核心不是“让每个版本都被收录”,而是让每个版本出现在它该出现的地方。地址唯一、标注正确、内容对得上,剩下的交给抓取节奏即可。