网站收录

多语言版本怎么收录:hreflang、语言目录与重复内容的关系

多语言站点常遇到同一内容对应多个地址、收录归属不清的问题。本文从 URL 结构选择、hreflang 标注、语言切换方式和翻译质量几个方面,说明怎样减少重复内容、让各语言版本被正确识别,并给出按目录检查收录状态的实用方法。

网站收录

多语言版本怎么收录:hreflang、语言目录与重复内容的关系

多语言、多地区站点在收录上遇到的问题,往往不是蜘蛛没来,而是同一份内容对应了多个地址:搜索引擎需要判断该把哪个版本放进索引,又该在哪个地区的搜索结果里展示。把结构和信号理清楚,通常比反复提交 URL 更有效。

先确定一套稳定的 URL 结构

常见做法有三种,各有代价:

  • 子目录:example.com/en/、example.com/de/。集中在同一域名下,内链和外部信号容易汇总,多数情况下最省心。
  • 子域名:en.example.com。适合各地区由不同团队、不同服务器维护的情况,但语言版本之间的关联需要额外维护。
  • 参数或 cookie 切换:如 ?lang=en,或按用户地区自动切换。这类写法最容易出问题,参数版本容易被当成重复内容,cookie 切换则让蜘蛛只能看到默认版本。

结构定下来之后就不要在语言之间反复调整。目录一改,旧地址就需要重新被抓取、重新被判断,中间会有一段状态不稳定的时期。

hreflang 是信号,不是开关

hreflang 的作用是告诉搜索引擎这几个地址属于同一内容的不同语言或地区版本,它影响的是展示层的选择,而不是收录本身。几个容易出错的点:

  • 必须互相指认:每个语言版本都要列出包括自己在内的全部版本,只做单向标注等于没标。
  • 每个版本都要自引用,缺少自引用时这条关系链可能被整体忽略。
  • 需要默认版本时用 x-default,指向不限定语言的那一版,通常是语言选择页或英文版。
  • 标注的地址应当是可直接访问的规范地址,不要指向被 robots.txt 屏蔽或需要登录的页面。
hreflang 不会让一个本来没被索引的页面进入索引,它只处理已经进索引的版本之间,谁该展示给谁的问题。

语言切换别用自动跳转

根据浏览器语言或 IP 自动跳转到对应版本,对用户看似友好,对抓取却不太友好:蜘蛛通常从某个固定地区发起请求,看到的可能永远是同一个版本,其他语言目录更难被发现。同时不同地区用户拿到的地址不同,也容易造成同一页面出现多个入口。更稳妥的做法是默认语言固定在根目录或明确的语言目录,其他版本之间用可见链接互相连接,把切换变成用户主动点击的一步。

翻译质量决定这一版值不值得进索引

同一主题的多语言版本如果只是机器翻译的粗稿,句式不通、术语前后不一致,很容易被判定为与原文高度相似的低价值页面。结果常见的是原文收录正常,其他语言版本长期停留在已抓取、尚未编入索引。几个可操作的判断标准:

  • 标题、描述和正文是否针对该语言重新组织,而不是逐句替换词汇。
  • 本地化的关键词是否有实际搜索需求,而不是直译出来的词。
  • 页面上的货币、单位、联系方式、服务时间是否与该地区一致。
  • 内链是否指向同语言目录内的页面,而不是全部指回默认语言。

如果某个语言只有零星几页翻译,不妨先只保留一个语言版本,不要为了凑数量铺开大量薄页面。

怎么检查各语言目录的收录情况

  1. 用 site:example.com/en/ 之类的限定查询,逐语言目录看大致覆盖面,注意这只是抽样,不等于准确索引量。
  2. 在服务器日志里按目录前缀过滤,看蜘蛛对各语言目录的抓取次数是否严重失衡。
  3. 在搜索控制台按目录建立分组,对比各语言版本的抓取、展示与点击趋势。
  4. 抽查几个语言版本的页面,确认 hreflang 标签完整、双向、地址可正常访问。

收录状态会随内容质量和结构调整而变化,多语言站点尤其如此。把 URL 结构、语言之间的链接关系和 hreflang 标注固定下来,再按目录持续观察,比每次发现问题就临时提交一批 URL 更接近长期解法。