网站收录

同一页面出现多个 URL:收录分散前先把 URL 规范化做对

同一个页面存在多个可访问地址,是收录分散最常见的原因之一。本文梳理大小写、结尾斜杠、跟踪参数、www 变体等常见来源,并给出站内链接统一、301 重定向、canonical 三层处理顺序,以及上线前可执行的检查清单。

网站收录

同一页面出现多个 URL:收录分散前先把 URL 规范化做对

很多站点收录上不去,并不是页面质量差,而是同一个页面被拆成了好几个 URL。搜索引擎在每个地址上都看到一个内容差不多的页面,外链和站内权重被摊薄,收录自然零散。这类问题在覆盖率报告里常表现为重复网页,或者搜索引擎选择的规范网页与站点指定不一致。

同一份内容为什么会变成多个 URL

多数情况不是刻意为之,而是技术细节没统一:

  • 大小写不统一:/About 和 /about 在部分服务器上是两个地址,各自都能返回 200。
  • 结尾斜杠不一致:/article 与 /article/ 都能打开,谁也没重定向到谁。
  • 跟踪参数:分享链接自动带上来源参数,每次传播生成一个新地址。
  • 排序与筛选参数:列表页的排序、分页、筛选条件组合出大量近似的 URL。
  • 协议与域名变体:http 与 https、带 www 与不带 www 同时可访问。
  • 历史遗留入口:打印页、旧版模板页面、带会话标识的地址仍在线上。

先确定每个页面的唯一地址

处理顺序不要颠倒,从最彻底的一层做起。

第一层:站内链接只指向一个版本

导航、面包屑、正文内链、站点地图、RSS 里出现的地址必须完全一致。站内自己都在混用两个版本,规范标签的说服力会被明显削弱。

第二层:能 301 的就 301

大小写、结尾斜杠、www 这类变体,最直接的做法是 301 到规范地址,让用户和爬虫都落到同一个地方。这比只写规范标签更彻底,因为它不依赖搜索引擎的判断,也不需要等待重新处理。

第三层:canonical 处理无法重定向的情况

带参数的列表页、打印页这类页面往往需要保留访问能力,不方便直接跳转,这时用规范标签指向主版本。要注意它是建议而非指令,所以必须和前两层配合,不能单独依赖。

301 解决的是不让变体被访问,规范标签解决的是告诉搜索引擎哪个是主版本。两者解决的问题不同,不能互相替代。

带参数的页面该不该收口

排序、筛选参数不一定都要规范到列表首页。判断标准很简单:这个 URL 是否提供了别处没有的内容。如果参数只是把同一批结果重新排列,规范到无参数版本更合适;如果参数组合能形成独立的、有价值的主题页,保留并单独优化也说得通。怕的是既不收口,也不给它足够的入口和内容,让它长期停在半收录状态。

上线前的检查清单

  1. 用站内搜索或抓取工具找出指向同一内容的多个地址。
  2. 逐个确认变体返回的状态码,是 301 还是 200。
  3. 检查规范标签是否自引用,指向的地址是否可正常访问。
  4. 核对站点地图中的地址与站内链接、规范标签是否三方一致。
  5. 观察覆盖率报告里重复网页、已发现但未编入索引的数量变化。

规范化做对了,也不等于会被收录

URL 规范化只是把页面归拢到一个地址上,它解决的是分散问题,不解决内容质量和抓取权限问题。地址统一之后,是否被收录仍要看页面本身是否值得索引、是否允许抓取、是否有足够的站内入口。把规范化当成前提条件,而不是收录的保证。

这项工作也不是一次性的。模板改动、活动页上线、参数逻辑调整、域名迁移,都可能重新引入变体。把它固定成上线流程里的一道检查,比事后从索引里慢慢清理省力得多。