网站收录

大小写、结尾斜杠、www:URL 没统一,收录容易被拆成几份

同一个页面可能被 http/https、www、结尾斜杠、大小写和跟踪参数拆成好几个地址,搜索引擎会分别抓取、分别判断,外链与内链信号被分散,索引里也容易出现重复状态。文章讲清这些 URL 变体的来源、统一的正确顺序(先定规范地址,再用服务器 301、内部链接和 canonical 保持一致),以及排查方法和常见坑。

网站收录

大小写、结尾斜杠、www:URL 没统一,收录容易被拆成几份

同一个页面,在搜索引擎那里可能不止一个地址。带 www 和不带 www 各算一个,http 和 https 各算一个,结尾有没有斜杠各算一个,大小写不同也可能各算一个。这些地址如果都能正常打开,搜索引擎就会分别抓取、分别判断。结果往往是:收录量看着涨了,但每个地址分到的信号都很薄。

URL 变体一般从哪来

多数站点的重复 URL 不是刻意造出来的,而是几个小习惯叠加出来的:

  • 协议与主机名:http 和 https 同时可访问;www.example.com 和 example.com 都能打开。
  • 结尾斜杠:/about 和 /about/ 返回同一份内容。
  • 大小写:/Product/1 和 /product/1 在区分大小写的服务器上可能是两个路径。
  • 默认文件名:/index.html、/index.php 和根目录指向同一页。
  • 跟踪参数:?utm_source=…、?ref=…、?fbclid=… 会生成大量带参数地址,内容其实一样。

它和收录是什么关系

搜索引擎的索引单位是 URL,而不是"页面"。同一份内容对应多个 URL 时,常见两种结果:

  • 所有版本都被抓取,但只有其中一个被编入索引,其余显示为重复网页、未编入索引一类的状态;
  • 几个版本轮流出现在索引里,索引报告看起来忽多忽少、不太稳定。

不论哪种,指向这个页面的外链和内链都会被拆到不同地址上,页面本身积累的信号变弱。抓取机会也会被分掉一部分——同样的内容被反复抓,蜘蛛停留在其他页面上的时间就少了。

先确定唯一的规范地址

动手之前要先定一个"正版":

  1. 协议一般选 https,现在证书成本很低,没有必要两个都留。
  2. 主机名看历史:已经积累外链的那一个尽量保留,证书和备案也要能覆盖。
  3. 结尾斜杠、大小写、默认文件名各选一种写法,全站统一。

这个决定做过之后不要反复改。协议、主机名来回切换,等于把刚建立的信号又打散一次。

统一的具体做法

  1. 服务器层做 301:把非规范形态永久跳转到规范地址。www、协议、默认文件名适合用 301;结尾斜杠和大小写要谨慎,规则写得太宽,会把本该存在的不同页面也一起跳走。
  2. 站内链接自己先统一:导航、正文内链、面包屑、页脚、sitemap、canonical、og:url,全都写成规范地址。只做服务器跳转、内部链接还指向旧形态,相当于每次点击都多绕一跳。
  3. 跟踪参数单独处理:不影响内容的参数,可以在页面上用 canonical 指向干净地址,也可以配置参数识别规则。不建议一上来就在 robots.txt 里屏蔽,屏蔽之后连 canonical 都读不到。
  4. 副本归位:打印版、移动版、AMP 之类的副本,用 canonical 指向主版本,而不是让它们各自参与竞争。

怎么确认有没有漏网的

  • 用 site: 查询看索引里出现的地址形态,是否只剩一种前缀。
  • 翻一段时间的服务器日志,统计访问到同一内容的 URL 有多少种写法。
  • 抽查首页、栏目页、内容页各几条,看跳转链是否一次到位,有没有 A→B→A 的循环。
  • 改完之后观察几周,重复与未编入索引的状态会慢慢减少,但不会一夜之间清空。

几个容易踩的坑

  • 用 canonical 代替 301。canonical 只是提示,不是强制,用户和蜘蛛走的仍是旧地址。
  • 跳转规则写得太激进,把参数页、子目录页一起跳到首页,反而制造出软 404。
  • 只处理了首页,栏目页和内容页仍是混合形态。
  • 改完就等着收录数字变化。URL 统一解决的是"自己给自己制造的重复",能不能被收录,还要看内容本身有没有价值。
URL 统一不会直接带来收录,但它能让你之后看到的收录数据更接近真实情况——否则你连"到底收录了多少页面"都判断不准。