很多站点收录上不去,并不是页面质量差,而是同一个页面被拆成了好几个 URL。搜索引擎在每个地址上都看到一个内容差不多的页面,外链和站内权重被摊薄,收录自然零散。这类问题在覆盖率报告里常表现为重复网页,或者搜索引擎选择的规范网页与站点指定不一致。
同一份内容为什么会变成多个 URL
多数情况不是刻意为之,而是技术细节没统一:
- 大小写不统一:/About 和 /about 在部分服务器上是两个地址,各自都能返回 200。
- 结尾斜杠不一致:/article 与 /article/ 都能打开,谁也没重定向到谁。
- 跟踪参数:分享链接自动带上来源参数,每次传播生成一个新地址。
- 排序与筛选参数:列表页的排序、分页、筛选条件组合出大量近似的 URL。
- 协议与域名变体:http 与 https、带 www 与不带 www 同时可访问。
- 历史遗留入口:打印页、旧版模板页面、带会话标识的地址仍在线上。
先确定每个页面的唯一地址
处理顺序不要颠倒,从最彻底的一层做起。
第一层:站内链接只指向一个版本
导航、面包屑、正文内链、站点地图、RSS 里出现的地址必须完全一致。站内自己都在混用两个版本,规范标签的说服力会被明显削弱。
第二层:能 301 的就 301
大小写、结尾斜杠、www 这类变体,最直接的做法是 301 到规范地址,让用户和爬虫都落到同一个地方。这比只写规范标签更彻底,因为它不依赖搜索引擎的判断,也不需要等待重新处理。
第三层:canonical 处理无法重定向的情况
带参数的列表页、打印页这类页面往往需要保留访问能力,不方便直接跳转,这时用规范标签指向主版本。要注意它是建议而非指令,所以必须和前两层配合,不能单独依赖。
301 解决的是不让变体被访问,规范标签解决的是告诉搜索引擎哪个是主版本。两者解决的问题不同,不能互相替代。
带参数的页面该不该收口
排序、筛选参数不一定都要规范到列表首页。判断标准很简单:这个 URL 是否提供了别处没有的内容。如果参数只是把同一批结果重新排列,规范到无参数版本更合适;如果参数组合能形成独立的、有价值的主题页,保留并单独优化也说得通。怕的是既不收口,也不给它足够的入口和内容,让它长期停在半收录状态。
上线前的检查清单
- 用站内搜索或抓取工具找出指向同一内容的多个地址。
- 逐个确认变体返回的状态码,是 301 还是 200。
- 检查规范标签是否自引用,指向的地址是否可正常访问。
- 核对站点地图中的地址与站内链接、规范标签是否三方一致。
- 观察覆盖率报告里重复网页、已发现但未编入索引的数量变化。
规范化做对了,也不等于会被收录
URL 规范化只是把页面归拢到一个地址上,它解决的是分散问题,不解决内容质量和抓取权限问题。地址统一之后,是否被收录仍要看页面本身是否值得索引、是否允许抓取、是否有足够的站内入口。把规范化当成前提条件,而不是收录的保证。
这项工作也不是一次性的。模板改动、活动页上线、参数逻辑调整、域名迁移,都可能重新引入变体。把它固定成上线流程里的一道检查,比事后从索引里慢慢清理省力得多。