在站点运营中,筛选、排序、分页、追踪等交互功能常常会给URL带上参数。对用户来说,这些参数让页面更好用;但对搜索引擎蜘蛛来说,如果处理不当,同一批内容可能裂变成几十个甚至上百个地址。抓取配额是有限的,重复地址多了,真正需要被发现的页面反而可能被挤到后面。
参数URL通常从哪里来
常见的参数来源包括:
- 列表页的筛选条件,比如价格区间、品牌、颜色、尺寸。
- 排序方式,比如按销量、按价格、按上架时间。
- 分页参数,比如 ?page=2、?p=3。
- 追踪参数,比如来源、活动、广告渠道。
- 站内搜索、用户中心、打印页等动态地址。
这些参数有些会影响页面主要内容,有些只是改变展示顺序或附加信息。运营需要先区分它们,再决定让不让蜘蛛抓取。
重复地址带来的实际问题
当同一批商品或文章通过不同参数组合生成多个URL时,容易出现几个问题:
- 抓取配额被消耗:蜘蛛把时间花在相似页面上,新内容或重要栏目可能得不到足够关注。
- 重复内容分散权重:多个地址指向几乎相同的内容,搜索算法难以判断哪个是主版本。
- 数据统计混乱:不同参数地址都被访问,日志和统计工具里的数据会互相干扰。
- 站点质量感知下降:大量低价值或空结果页面被索引,可能影响整体评价。
这些问题不一定立刻显现,但在站点规模变大后会越来越明显。
区分参数类型:功能性还是内容性
处理参数的第一步,是把参数分成两类:
- 内容性参数:参数变化后,页面主体内容确实不同。例如商品详情页的颜色参数,可能对应不同SKU。这类地址通常值得保留,但要做好唯一性管理。
- 功能性参数:参数只改变排序、视图、追踪或会话状态,不改变核心内容。例如 ?sort=price_asc、?utm_source=xxx。这类地址一般不需要被蜘蛛抓取。
对于筛选参数,还要看筛选后的结果是否有独立价值。如果筛选组合能形成有搜索需求的聚合页,可以考虑保留少数优质组合,其余用技术手段收敛。
常用的处理方式
1. 规范链接(canonical)
在带参数的页面上,通过 canonical 标签指向无参数或标准版本的URL。这样可以帮助搜索引擎理解哪个地址是主版本。注意 canonical 要指向真实可访问、内容一致的页面,不要指向404或另一组参数。
2. robots.txt 屏蔽
对于纯功能性参数,比如排序、追踪、会话ID,可以在 robots.txt 中屏蔽对应模式。但robots.txt只是禁止抓取,如果这些地址已经被收录,屏蔽后搜索引擎仍可能保留旧索引。因此更适合配合其他方式使用。
3. nofollow 与链接控制
在筛选、排序的链接上添加 rel='nofollow',可以减少蜘蛛沿着这些链接发现大量参数组合。不过nofollow是建议性标签,不能完全依赖。更重要的是从信息架构上减少不必要的参数入口。
4. 参数处理工具
如果站点使用主流搜索引擎的站长平台,可以在后台设置URL参数效果,告诉搜索引擎哪些参数不影响内容。这可以帮助减少重复抓取,但设置前要确认参数规则准确。
5. 统一分页与视图
分页参数尽量保持简洁,比如固定使用 ?page=n。不要同时存在 ?p=、?pg=、?page= 等多种写法。列表视图、网格视图这类只改变展示方式的参数,最好用cookie或前端切换,不要生成新URL。
筛选排序页的取舍
筛选和排序页对用户体验有价值,但不代表每个组合都值得被索引。运营可以遵循一个原则:
- 有独立搜索需求、内容丰富的筛选组合,可以保留并优化。
- 组合数量巨大、内容重复度高的筛选,建议屏蔽或使用canonical收敛。
- 排序参数通常不需要独立索引,统一指向默认排序版本即可。
- 空结果页、无结果的筛选页,不要生成可抓取地址,或返回404/410。
如果筛选组合太多,可以考虑只开放一级筛选,二级筛选用JavaScript或表单提交,不直接暴露成链接。
自查清单
运营可以定期检查以下几点:
- 随机抽取列表页,看看筛选、排序、分页后URL参数是否可控。
- 用站长平台或日志,查看带参数的地址是否被大量抓取。
- 检查带参数页面上的canonical是否指向正确版本。
- 确认robots.txt中的参数屏蔽规则没有误伤正常内容。
- 查看站内搜索、用户中心等动态页面是否被大量索引。
- 统计参数地址的收录情况,对比无参数地址的流量差异。
- 新功能上线前,评估它是否会生成新的参数URL,并提前规划处理方式。
参数本身不是问题,失控的参数才是。把该收敛的收敛,该保留的保留,蜘蛛才能把抓取留给真正有价值的页面。
URL参数治理不是一次性的工作,而是随着功能迭代持续维护的细节。运营不必追求完全消灭参数,但要让参数地址处于可控范围。定期查看抓取数据,及时调整规则,比一次性大改更稳妥。