网站收录

参数 URL 的收录取舍:筛选、排序和追踪参数该怎么处理

筛选、排序、追踪参数会生成大量相似地址,容易占用抓取资源、稀释链接信号。本文按参数用途分类,给出追踪参数、筛选组合与分页的处理边界,并附一个可执行的自查顺序,帮助把抓取和索引集中到真正有价值的地址上。

网站收录

参数 URL 的收录取舍:筛选、排序和追踪参数该怎么处理

同一批内容,因为筛选、排序、追踪参数的存在,可能生成出成百上千个地址。这些地址大多只是同一页面的变体,却会占用抓取资源、稀释链接信号,也让索引里出现大量似曾相识的页面。参数 URL 的处理,本质是判断哪些地址值得被蜘蛛单独认识,哪些应该被合并回主地址。

第一步:给参数分类,而不是一刀切

参数处理最忌讳全局屏蔽或全部放开。先按用途分三类,处理方式完全不同。

  • 内容型参数:参数不同,页面主体内容确实不同,例如商品 ID、文章 ID。这类地址通常应当可以被抓取和索引。
  • 筛选与排序型参数:如 color=red、sort=price、page=2。多数情况下是同一批内容的重排,是否收录取决于该组合是否有独立搜索需求。
  • 追踪型参数:utm_source、gclid、fbclid、ref 等,只用于统计来源,不改变内容。

追踪参数:优先级最高的收敛对象

追踪参数是重复内容最常见的来源。外链、广告、社媒分享往往会带上这些参数,导致蜘蛛从不同入口抓到同一页面。

  1. 在服务器或 CDN 层把已知追踪参数剥离,再 301 到干净地址。
  2. 页面 canonical 始终指向不带追踪参数的规范地址。
  3. 站内链接、sitemap、分页链接不要带追踪参数。

如果站点无法在服务端做剥离,至少要保证这些参数地址能被 canonical 明确指向主地址,而不是各自为政。

筛选与排序参数:看搜索需求,也看抓取成本

很多电商和内容站会纠结:筛选组合要不要收录?判断标准可以拆成两点。

值得放开的信号

  • 该组合有真实的搜索量,用户会直接搜“红色 连衣裙 长款”这类词。
  • 筛选结果页有独立价值:独立标题与描述、结果数量足够、不是空列表。
  • 站内已有稳定的内链入口,而不是只靠参数拼接产生。

应当收敛的信号

  • 组合数量巨大,且大部分结果为空或高度重复。
  • 同一批商品只是顺序不同,没有独立信息价值。
  • 参数可以无限叠加,蜘蛛容易陷入循环抓取。

收敛手段通常组合使用:不产生内链入口、canonical 指向主列表、必要时对无价值组合用 noindex。需要提醒的是,robots.txt 屏蔽和 noindex 不能同时指望——被 robots.txt 拦住的 URL,蜘蛛读不到页面上的 noindex,已经存在的索引可能长期留在那里。

分页参数 page= 的处理边界

分页参数属于筛选参数的一种,但更常被单独讨论。一般做法是:分页地址可以被抓取,让蜘蛛顺着翻到更深的内容;但分页本身通常不需要作为独立的索引对象。canonical 指向第一页,还是保留自指并配合合理的内部链接,取决于站点结构。

关键不在参数本身,而在于翻页是否通向有价值的详情页。如果翻到第 20 页仍然只是重复列表,就没有必要让蜘蛛一直翻下去。

一个可执行的自查顺序

  1. 导出近期被蜘蛛抓取的 URL 样本,按参数归类,统计各类占比。
  2. 找出参数页面里被索引的比例,以及这些页面的落地转化情况。
  3. 对比同一内容的有参数与无参数版本,看索引里是否出现多个地址。
  4. 优先处理追踪参数,再处理高频筛选参数,最后处理分页。
  5. 调整后观察抓取分布的变化,而不是只看索引量的涨跌。
参数 URL 的目标不是让蜘蛛少抓,而是让抓取和索引落在真正需要被看到的地址上。收敛得当,抓取预算会自然流向有价值的页面。

最后一点:参数处理没有一次到位的方案。站点改版、筛选维度增加、投放渠道变化,都会让原本干净的参数结构重新变乱。把它当成定期复查的项目,比追求一次性做完美更现实。