把目标 URL 打包成短链再放进入口页,是不少人图省事的做法:链接短、看起来干净,还能顺便统计点击。但短链的本质是“再跳一次”,搜索蜘蛛愿不愿意走完这一跳,和直接写超链接完全不是一回事。
短链在入口页上常见的三种形态
1. 302 / 307 服务端跳转
入口页里是一个指向短链域名的普通 a 标签,访问短链域名后由对方服务器返回 302,再跳到目标 URL。这是最主流的形式,也是最容易被搜索蜘蛛跟进的,前提是短链服务本身允许抓取。
2. meta refresh 或 JS 跳转
短链服务没有做服务端跳转,而是返回一个中间页,用 meta refresh 或 JavaScript 完成跳转。这类中间页本身可能带着 noindex,或者被 robots.txt 屏蔽,搜索蜘蛛走到这一层就停下的概率明显更高。
3. 中间页展示目标地址
有些服务会给一个“即将离开本站”的确认页,把目标 URL 显示成可点击文本。这种情况搜索蜘蛛能不能发现目标,取决于它有没有把那个链接当成可抓取的超链接处理。
搜索蜘蛛处理短链时,常遇到哪些拦路虎
- 短链服务的 robots.txt:大部分短链平台自己并不希望被大量抓取,屏蔽跳转路径是常规操作。一旦被屏蔽,这条跳转链就断了。
- 对蜘蛛返回不同内容:有些平台会识别 UA,对搜索蜘蛛返回验证页、空页,或者干脆不跳转。
- 跳转层数:短链外面再套短链,或者目标 URL 自身还有 301,很容易凑成三四层。层数越多,中途放弃的可能性越大。
- 被 WAF 和风控拦住:机房 IP 段访问过于频繁,被短链平台的风控当成异常流量,返回验证码页面。
- 短链带统计参数:部分短链在跳转时附加大串 utm 参数,最终落到目标 URL 上的是另一个带参数的地址,和你提交的 URL 并不完全一致。
- nofollow 属性:短链服务有时会给中间页的链接加 nofollow,或者入口页作者自己加了,抓取信号会被削弱。
如果确实要用短链,怎么做相对稳妥
- 优先自建跳转。用自己的域名做一个跳转页,返回 301,并在 robots.txt 中明确放行该路径,可控性比第三方短链高一个量级。
- 少套一层。短链直接指向目标 URL,不要再经过二次跳转。
- 入口页同时保留真实链接。除了短链,把目标 URL 以可点击的普通超链接,或者纯文本形式再写一遍,相当于给搜索蜘蛛留一条备选路径。
- 检查短链服务是否屏蔽蜘蛛。可以直接查对方 robots.txt,也可以看服务器日志里短链域名有没有出现搜索蜘蛛的访问记录。
- 看日志而不是猜。在目标 URL 的访问日志里筛搜索蜘蛛 UA,如果只有你自己浏览器的访问记录,说明这一跳大概率没走通。
- 控制数量。入口页上全是短链,整页可识别信息会变少,不利于搜索蜘蛛判断这页在做什么。
短链适合对外分发和点击统计,不适合当作搜索蜘蛛发现 URL 的主要通道。能在入口页直接给出目标 URL 的,就不要绕这一跳。
更省心的替代思路
如果目的是让搜索蜘蛛发现目标 URL,最直接的办法还是在入口页里用标准 a 标签写出完整的目标地址,配合简单清楚的锚文本和周围文字说明。短链可以同时存在,但应该当成补充,而不是唯一入口。至于最终能不能收录,仍取决于目标页自身的质量和站点整体情况;短链换不换、蜘蛛走不走得通,只影响“有没有被发现”这一步。