网站收录

多语言和地区版本页面:收录时是按一个页面还是几个页面算

做多语言或分地区站点时,同一个产品往往有英文页、中文页、日文页。本文说明搜索引擎为什么把每个语言版本当成独立 URL 分别处理,hreflang 能做什么、不能做什么,自动跳转带来的抓取偏差,以及一套可落地的多语言站点收录排查顺序。

网站收录

多语言和地区版本页面:收录时是按一个页面还是几个页面算

做多语言或分地区站点的人常会遇到一个疑问:同一个产品的英文页、中文页、日文页,到底是算一个页面的几个版本,还是三个各自独立的页面?从抓取和索引的角度看,结论偏向后者——搜索引擎会把每个语言、每个地区的 URL 当成独立页面来对待。

每个语言版本都是独立 URL,索引也各算各的

只要 URL 不同,搜索引擎看到的就是不同的资源。它们各自有独立的抓取记录、索引状态和覆盖报告条目。也就是说,英文页被收录,并不代表日文页也会被收录;英文页从索引里掉出去,也不会自动影响中文页。这一点在实际运营中经常被忽略,很多人发现某个语言版本没进索引时,会去检查整个站点的整体状态,实际上只要盯住这个语言目录下的 URL 就够了。

hreflang 不负责收录,只负责“配对”

hreflang 的作用是告诉搜索引擎:这几个 URL 是同一内容的不同语言或地区版本,请在对应语言或地区的搜索结果里优先展示匹配的那一个。它不会让页面更容易被收录,也不会把几个版本合并成一条索引记录。它解决的是一组页面之间的对应关系,而不是收录与否的问题。常见的配置要点有这些:

  • 必须双向互指。A 页指向 B 页,B 页也要指回 A 页,单方面声明往往会被忽略。
  • 语言代码和地区代码要写规范,例如 zh-Hans、en-US,不要用自行发明的简写。
  • 如果整组页面有明确的默认版本,可以用 x-default 标注兜底版本。
  • hreflang 指向的 URL 必须能正常访问,指向 404、跳转页或已被屏蔽的地址都会让整组配对失效。

只配 hreflang,不解决内容重复

有些站点把 hreflang 写得非常完整,但几个语言版本的正文其实是同一段文字。这种情况下,索引里往往只会保留其中一条,其他版本被当作重复内容处理。配对标签说明的是“关系”,不会改变“内容是否雷同”这个事实。

自动跳转和语言猜测带来的抓取偏差

不少站点用 IP 归属地或浏览器语言自动跳转到对应版本。这对真实用户是友好的,但对蜘蛛不太友好:蜘蛛通常从固定的出口 IP 抓取,容易永远只看到某一种语言,其余语言的 URL 可能长期停在“已发现但未抓取”的状态。

相对稳妥的做法是,让默认语言版本可以直接访问,其他语言版本通过页面上明显的切换入口进入;如果确实需要跳转,也建议在页面上保留指向所有语言版本的普通链接,让蜘蛛有路径走完全部版本。

机器翻译和内容雷同的版本容易被判重复

有的站点为了凑语言数量,把英文正文原样搬到中文页,只改了标题和导航。这类页面即便被抓取,也常常拿不到稳定的索引位置。判断标准其实很简单:换一个语言的用户打开这个页面,能不能读到用该语言写的、独立成篇的内容。如果只是同一段话的机械替换,收录效果通常不会理想。

检查多语言站点收录时的几个步骤

  1. 在索引覆盖报告里按语言目录(如 /en/、/de/、/ja/)分别看收录数量,找出明显偏低的目录。
  2. 确认每种语言是否落在清晰的子目录或子域名下,避免同一语言散落在多个无规律的路径里。
  3. 抽查几组页面的 hreflang,确认双向指向、无死链、无指向被屏蔽的地址。
  4. 看服务器日志里各语言目录的抓取频次,判断是否存在只抓默认语言、其余版本长期无人问津的情况。
  5. 抽样对比各语言版本的正文,检查是否存在翻译没做完、只剩模板内容的情况。

关于用工具“催收录”的一个提醒

有人会想到用蜘蛛池之类的工具去推动多语言页面被访问。需要分清的是,这类工具能增加 URL 被发现和被请求的概率,属于抓取环节的事;但如果页面本身没有独立内容、配对关系混乱、站点整体质量不高,抓取之后依然可能停在“已抓取但未编入索引”。发现、抓取、索引是三道不同的关卡,工具能影响的主要是前一道半。

多语言站点的收录问题,核心往往不是“蜘蛛来得够不够多”,而是每个语言版本有没有独立价值、版本之间的对应关系是否清楚、访问方式有没有互相打架。