做入口页的时候,很多人是从目标站直接复制链接的,复制到哪里就贴到哪里。于是一个入口页上同时出现了 http://example.com/a、https://www.example.com/a、https://example.com/a/ 这几种写法。它们在浏览器里都能打开,看上去没什么差别,但在搜索蜘蛛的视角里,这些往往并不是同一个 URL。
为什么同一篇文章会出现好几种写法
- 目标站本身就支持多个版本访问,比如 http 和 https 都在跳转前可打开。
- 链接来自不同渠道,有人复制带 www 的,有人复制不带 www 的。
- 站点中途换过域名、加过 https,老链接没清理,新链接又是另一种写法。
- 手工拼接链接时,结尾斜杠加不加、大小写怎么写,全凭习惯。
搜索蜘蛛眼里,哪些差别算不同 URL
协议:http 与 https
http 和 https 通常被当作两个不同的地址。即使目标站做了跳转,搜索蜘蛛也要先访问原地址、再跟随跳转,才能到达最终页面。入口页里两种协议混着写,等于把同一批目标拆成两批地址去发现。
主机名:www 与非 www
www.example.com 和 example.com 一般也不会自动合并。除非目标站把其中一个 301 到另一个,否则在抓取层面它们就是两个入口。入口页如果两种写法各出现一部分,日志里看到的形态会很杂。
路径细节:结尾斜杠、大小写、默认端口
这部分情况要分开看。默认端口(:80、:443)和主机名大小写,搜索引擎通常会做归一化处理;但路径部分的大小写、结尾斜杠加不加,通常会当成不同地址,尤其是服务器对这两者返回不同状态码的时候。
混用会带来哪些实际问题
- 发现数量虚高:入口页声明的链接数看起来很多,实际指向的页面可能只有一半。
- 抓取变分散:同一内容要被抓取多次,落在真正新页面上的抓取机会就少了。
- 日志难判断:排查“搜索蜘蛛到底有没有发现目标 URL”时,同一页面以多种形态出现,容易得出错误结论。
- 信号被拆开:如果目标站侧没有做好规范化,多个版本各自被访问、各自积累链接信号,效果被稀释。
先确定规范版本,再统一入口页
- 在目标站确认一个规范地址,明确用哪个协议、带不带 www、路径怎么写。
- 访问目标站的其他版本,看是否稳定 301 到规范地址,最终落地 URL 是什么。
- 回到入口页,把目标链接统一改成规范写法,尽量使用完整绝对地址。
- 检查入口页其他位置,比如页脚、侧栏、分页,是否还残留旧写法的链接。
- 过一段时间看日志,观察搜索蜘蛛访问的 URL 形态是否收敛。
已经混用了,怎么收拾
不需要把入口页全部推倒重来。新增的链接一律用规范写法,存量链接按重要性分批替换:指向重点目标页的优先处理,长尾的可以慢慢来。更根本的一步在目标站侧,用 301 和 canonical 把多个版本收敛到一个地址,入口页怎么写都不会造成太大偏差。
统一 URL 写法只是把发现路径理顺,让搜索蜘蛛少走弯路。它不等于收录会立刻改变,抓取、索引、排序本来就是三个不同的环节,别把这一步当成万能开关。
小结一下:入口页里的链接写法,能统一就统一,尤其是协议和主机名这两层。这一步花不了多少时间,却能让后续的抓取日志好读很多,排查问题时也少一些干扰项。