网站收录

同一页面被拆成多个 URL:大小写、斜杠、参数版本该怎么收口

同一页面被拆成多个 URL,会让收录分散、更新不同步。本文梳理常见的地址分裂来源,区分哪些该合并、哪些该单独保留,并给出 301、canonical、内链与站点地图的统一顺序,以及收口后的观察要点。

网站收录

同一页面被拆成多个 URL:大小写、斜杠、参数版本该怎么收口

同一个页面在搜索引擎眼里变成好几个地址,是收录里很常见的一类问题。表现是索引中出现多个相似 URL,权重被分散,内容改了一版却只更新了其中一个。多数情况不是蜘蛛抓错了,而是站点自己给了它太多入口。

常见的 URL 分裂来源

  • 大小写:/Page 与 /page 在部分服务器上属于两个地址。
  • 结尾斜杠:/a 与 /a/ 同时可访问,且都返回 200。
  • 协议与域名:http、https、www、非 www 混用。
  • 跟踪参数:?from=xxx、?utm_source=xxx 生成大量变体。
  • 参数顺序与重复:?a=1&b=2 与 ?b=2&a=1。
  • 分页、排序、筛选参数被当成独立内容页处理。
  • 会话 ID、打印页、移动独立域名等历史遗留地址。

先分清哪些算同一个页面

判断依据不是 URL 长得像不像,而是主体内容是否一致:标题、核心正文、主要模块是否相同。只有参数不同、结果集完全一样,通常算同一页面;筛选后展示的是另一批商品或另一组文章,它其实是不同的页面,需要单独考虑是否值得收录。

该合并的

  • 只差跟踪参数、大小写、斜杠、协议域名的地址。
  • 排序方式不同,但内容集合相同的列表页。

该单独对待的

  • 筛选出真实不同结果集,并且确实有搜索需求的页面。
  • 分页中的关键页,尤其是有内链入口、深度较大的页。

收口的顺序建议

  1. 先定一个规范地址:协议、域名、路径写法全站统一。
  2. 服务端做 301:把旧写法、大小写变体、带跟踪参数的地址跳到规范地址,而不是都返回 200。
  3. 内链全部指向规范地址:导航、面包屑、正文链接、分页链接都要改,别只改一处。
  4. canonical 与 301 保持一致:canonical 指向的地址应就是 301 的目标,不要互相矛盾。
  5. 站点地图只提交规范地址,减少额外入口。
  6. 参数页按价值处理:无价值的筛选组合用 noindex 或 robots 收口,结果唯一且有价值的保留,并给独立标题。

收口之后要观察什么

  • 日志中这些变体地址的抓取是否下降,是否转向规范地址。
  • 索引里相似 URL 的数量是否在减少,这通常需要时间,不会立刻变化。
  • canonical 是否被采纳,可以看搜索引擎最终选择的规范地址。
  • 规范地址自身的收录与表现是否稳定,而不是只看索引总数。
301 是给蜘蛛的强信号,但不是立刻生效的开关。旧地址在索引里存在一段时间属于正常现象,重点是不让多个可访问、可被抓取的版本长期并存。

几个容易踩的坑

  • 用 JS 跳转代替 301,蜘蛛未必按预期跟随。
  • canonical 指向一个本身返回 404 或需要登录的地址。
  • 把所有参数页一刀切屏蔽,连有搜索需求的筛选页也一起挡掉。
  • 只改站点地图不改站内链接,蜘蛛仍能从内链发现旧地址。

URL 收口本质上是减少重复入口,让同一个页面只留下一个明确身份。先把地址统一,再谈收录推进速度,顺序反了往往会反复返工。