网站收录

移动版和桌面版分成了两个 URL:收录该怎么归并

独立 m 站和 PC 站各有一套 URL 时,收录容易出现两份副本。本文梳理响应式、动态服务和独立移动站的差别,说明 canonical 与 alternate 的指向原则、移动版被 robots 或 noindex 误伤的常见情况,以及用双 UA 抓取自查的顺序。

网站收录

移动版和桌面版分成了两个 URL:收录该怎么归并

移动优先索引之后,搜索引擎抓取和评估的通常是移动版内容。如果站点用响应式设计,PC 和手机共用一个 URL,这件事基本不用操心;但不少老站或特定架构仍然保留独立的 m 站,PC 和移动端各有一套地址。这时收录就变成两个 URL 的问题:能不能归并成一份,以及由谁代表这一页。

先分清三种移动适配方式

  • 响应式:同一个 URL,靠 CSS 适配。收录只需要处理一个地址。
  • 动态服务:同一个 URL,根据 UA 返回不同的 HTML。URL 层面仍然是同一个。
  • 独立 m 站:如 m.example.com 或 /mobile/ 目录,PC 和移动各有一个地址,需要显式建立对应关系。

前两种的收录问题一般出在内容一致性上,第三种才会出现同一页面被收录两次的情况,也是需要额外处理的一种。

归并的关键是 canonical 指向一致

对独立 m 站,常见做法是两套页面都设置 canonical,指向同一个代表版本。方向可以选 PC,也可以选移动,重点是两边的声明不要互相打架

  • PC 页面 canonical 指向自己,移动页面 canonical 指向 PC 地址:这是最常见的一种组合,代表版本是 PC 地址。
  • PC 页面 canonical 指向移动版:如果站点打算完全以移动版为准,也可以,但要保证 PC 页面也这么声明,而不是只有移动端单方面声明。
  • 两套页面各自 canonical 指自己,同时又互相加 alternate:这是最容易出问题的写法,相当于告诉搜索引擎两个都是正本。

如果站点支持 alternate 标记,例如在 PC 页面写 rel="alternate" 并带上 media 条件,它表达的是「这两个地址是同一页的不同呈现」,可以和 canonical 配合使用,但两者方向必须一致。各家搜索引擎对这类标记的支持程度不同,用之前最好先在日志和索引里验证实际效果。

移动版被屏蔽或内容被裁剪,是更常见的坑

有些站点出于性能或历史原因,把 m 站写进 robots.txt 的 Disallow 里,或者给移动页面加了 noindex。在移动优先索引下,这等于让搜索引擎看不到真正的移动内容,PC 版本也可能因此拿不到及时的更新索引。

另一种情况是移动版内容被大幅裁剪:正文只留前两段、结构化数据没有同步、关键内链被删掉。搜索引擎评估的是移动版,看到的内容比用户实际能获取的少,收录结果自然会受影响。

  • 检查 m 站是否被 robots.txt 或 noindex 拦下。
  • 对比两版的正文、标题、结构化数据是否一致。
  • 确认移动版的内链没有大量丢失。

跳转方式也会影响抓到的版本

用 UA 判断做 JS 跳转,或者用 302 临时跳转,会让蜘蛛在不同情况下看到不同结果。如果一定要跳,建议用服务端跳转并保持规则清晰:从 PC 到移动是单向的,不要让两边互跳,否则容易形成循环,蜘蛛最后可能只抓到一个空壳页。

自查顺序

  1. 用移动 UA 和桌面 UA 各抓一次两个 URL,把返回的 HTML 保存下来做对比。
  2. 检查两边的 canonical、alternate 是否自洽。
  3. 检查 robots.txt、meta robots、X-Robots-Tag 有没有误伤移动版。
  4. 在蜘蛛日志里确认两个 URL 都有正常抓取记录,状态码正常。
  5. 观察一段时间内的收录结果,看是否仍然存在两份副本。
移动适配不是配置一次就完事的工作。改版、新增模板、CDN 规则变动,都可能让两边的内容重新分叉。定期用同样的方法复查一遍,比等到索引里出现两份副本再补救要省力。