站内链接后面挂上一串参数,看起来只是多了几个字符,实际可能让同一个页面在蜘蛛眼里裂成几十个地址。对访客来说没差别,对抓取和统计来说却是另一回事。
参数是怎么堆出来的
大多数站点并不是故意制造重复地址,而是各种功能在不知不觉中给 URL 加了尾巴。
- 投放与分享用的追踪参数,比如 utm_source、from、share_id,同一条内容被转几次就有几个版本。
- 会话或用户标识,比如 sessionid、uid,每个访客看到的地址都不一样。
- 排序、筛选、视图切换参数,比如 sort、view=list、price=100-200。
- 分页与附属入口,比如 page=2、print=1、export=1。
- 站内搜索跳转、外部来源跳转留下的 ref、source 之类参数。
哪些该保留,哪些该收拢
处理之前先分类,不要一刀切。
- 有独立内容价值的参数页:例如筛选后的商品列表、按条件排列的目录页,用户会主动访问和分享。这类页面可以保留,但要给它独立的标题、稳定的规范链接,并确认页面上确有可抓内容。
- 纯记录性质的参数:追踪码、会话 ID、来源标记,页面主体内容不变,通常收拢到不带参数的主版本。
- 功能型参数:打印页、导出页、需要登录才可用的视图,一般不需要让蜘蛛单独收录。
落地处理方式
- 统一入口:导航、栏目页、内链、站点地图里只输出干净地址,不要把活动链接直接贴进正文。
- 规范链接:在页面里声明主版本,让参数版本指向不带参数的规范地址。
- 抓取与索引指令:对没有独立价值的参数页面给出明确指令,同时确认没有误伤重要页面。
- 参数剥离:在服务器或 CDN 层把已知的无意义参数去掉,注意跳转一次到位,不要做成多级绕路。
- 内链抽查:定期检查栏目页、相关阅读、面包屑里是否混进了带参数的链接。
验证与记录
改动之后需要观察:服务器日志里同一路径出现了多少种参数版本、抓取集中在哪些地址、搜索结果显示的是什么形态。建议把规则、生效时间、负责处理的人记在一张简单的表里。活动或新功能再带新参数时,照着表走,比每次重新排查省事。
参数治理不是一次性工作。新上线的功能往往会把新的参数重新带进来,把它列入上线检查项,比事后补救轻松得多。
两个常见误区
第一个误区是看到重复地址就急着全部屏蔽。更稳妥的做法是先分清哪些参数会影响内容、哪些只是记录来源,再决定用规范链接还是抓取指令。
第二个误区是把参数剥离做成多级跳转。本来是为了省事,结果访客和蜘蛛都多绕了几步,反而增加了到达目标页的路径长度。规则越简单、跳转越少,后续维护越不容易出错。