做收录时,很多人会先看内容质量、外链和抓取频次,却忽略了一个更基础的问题:页面地址本身是否统一。搜索引擎把 URL 当作识别页面的重要依据,同一篇内容如果存在多种写法,抓取、索引和后续的展示判断都可能被分散。
大小写:主机名不敏感,路径通常敏感
域名部分一般不区分大小写,Example.com 和 example.com 通常指向同一站点。但路径和文件名是否区分大小写,取决于服务器和系统环境。Linux 环境下常见的是区分大小写,/About 与 /about 可能是两个页面,也可能其中一个直接返回 404。
如果站点同时存在这两种写法且都能打开,就等于给同一内容增加了重复入口。更稳妥的做法是统一为小写路径,并在服务器层面把大写版本 301 到小写版本。
末尾斜杠:/a 与 /a/ 可能是两条 URL
带斜杠和不带斜杠,在 URL 规范里属于不同地址。有些服务器会自动跳转,有些则把两者都返回 200。对搜索引擎来说,如果两个地址都返回相同内容,又没有明确的规范信号,就可能被当作两条 URL 分别抓取和评估。
建议在站点层面确定一种形式,例如目录型地址统一带斜杠,文件型地址不带斜杠,然后用 301 把另一种形式收住。
追踪参数与筛选参数:同内容多地址的主要来源
广告来源、分享来源、会话 ID 这类参数,通常不会改变页面主体内容。但带参数的 URL 被大量传播后,蜘蛛可能会沿着这些地址反复抓取,消耗抓取预算,也会让收录判断更复杂。
- utm 类参数:建议在页面中通过 canonical 指向不带参数的规范地址。
- 筛选、排序、分页参数:先判断这些页面是否有独立价值,再决定是允许抓取还是用 robots.txt 收住。
- 会话 ID:尽量不要出现在站内链接里,避免蜘蛛跟着会话参数绕圈。
如果参数页面确实有搜索流量或独立内容,可以保留;如果只是同一批内容的排列组合,通常不值得让它们进入索引。
协议、域名与默认文件:规范地址要选一个
http 与 https、www 与非 www、带默认端口与不带默认端口、/index.html 与目录根地址,这些组合很容易形成多个入口。服务器应只保留一个主版本,其余通过 301 跳转。
规范地址不是只写一次,而是在每次新增入口、改版、投放活动链接时都要保持一致。入口越统一,后续的抓取和索引判断越简单。
锚点与前端路由
传统的 #anchor 锚点不会发送到服务器,通常只是页面内的定位,一般不作为独立 URL 参与索引。但如果站点用 hash 或 history 模式做前端路由,情况就不同:地址变化可能对应不同内容,蜘蛛需要执行 JavaScript 才能看到。这类地址是否收录,取决于渲染结果和内部链接是否可抓取。
抓取到多个地址之后会发生什么
蜘蛛发现多个地址后,会分别抓取,但不一定分别索引。搜索引擎会尝试判断这些地址是否指向同一内容,然后选出一个规范版本进入索引,其余可能被合并或留在索引之外。这个过程不是即时完成的,也不一定完全按站长期望来选。
所以,与其等收录结果出来再补救,不如在 URL 进入抓取队列之前就把它统一好。
可以按这个顺序检查
- 列出站点当前可能存在的多种 URL 写法。
- 确定唯一主版本,并配置 301 跳转。
- 检查站内链接、sitemap、canonical 是否都指向主版本。
- 对参数页面分类:保留、规范、屏蔽,分别处理。
- 用访问日志或抓取工具核对,蜘蛛实际抓取的是不是主版本。
URL 统一不会直接带来收录,但它能减少重复入口,让有限的抓取次数和索引判断更集中。对站点运营来说,这是一项基础但长期有效的工作。