网站收录

带参数的 URL 被大量收录:筛选、排序与追踪链接该怎么收口

带参数的 URL 被大量收录,是很多站点的常见困扰。本文把筛选、排序、追踪、会话等参数按用途分类,说明 canonical、robots.txt、sitemap 各自适合处理哪一类,并给出观察收口效果的顺序,帮你在不误伤有价值页面的前提下,让索引逐步收敛。

网站收录

带参数的 URL 被大量收录:筛选、排序与追踪链接该怎么收口

很多站点在查收录时都会遇到一个现象:真正的页面没几条,索引里却躺着一大串带问号的地址——?sort=、?color=、?utm_source= 之类的参数把同一个页面复制成了几十上百个版本。它们算不上垃圾页,但也很少有人真的需要从搜索引擎点进来。处理这类 URL,关键是先分清哪些参数有用,哪些只是系统留下的痕迹。

参数 URL 是怎么被收录的

搜索引擎并不天然排斥问号。只要链接出现在站内、sitemap 或外部来源中,并且返回正常内容,它就有机会被抓取和索引。常见的产生方式有几种:

  • 筛选和排序:商品列表按价格、销量排序,或按颜色、尺寸筛选,每次操作都生成新 URL。
  • 追踪参数:推广链接上的 utm 系列参数,被分享、转载后进入站内链接。
  • 会话与标识:早期系统把 sessionid、会员标识直接写进地址栏。
  • 分页与视图:翻页、切换列表与网格视图生成参数地址。

这些地址往往和主版本内容高度相似,一旦被大量收录,最直接的后果是分散抓取预算,让真正需要更新的页面排队更久;同时,同一内容对应多个 URL,也会让搜索引擎在挑规范版本时犯难。

先分类,再动手

参数治理最忌讳一刀切。把所有带问号的地址全挡掉,可能顺手把有价值的筛选组合也挡没了。可以先做一个简单分类:

  1. 有独立价值的参数页:某个筛选组合本身有稳定搜索需求,比如固定品牌加固定品类。这类页面内容足够独立,可以留着,并给它明确的标题、正文和自指 canonical。
  2. 无独立价值的参数页:排序、视图切换、临时筛选。这些页面内容与主版本基本一致,用户也不太可能搜到。
  3. 追踪参数:utm、ref、from 之类,只影响统计,不影响内容。
  4. 会话与身份参数:最好从源头就不产生,而不是靠后续规则收拾。

几种常见的收口方式

canonical 指向干净版本

对排序、视图、追踪参数这类页面,让 canonical 指向不带参数的主版本,是最省事的做法。注意 canonical 是建议而非命令,页面本身仍需可访问、内容一致,也不要在同一个页面里写多个互相矛盾的 canonical。

用 robots.txt 挡住

挡住抓取能省下抓取预算,但也有代价:一旦 URL 被 robots.txt 屏蔽,页面上的 noindex、canonical 等信号就传不回来了,已经收录的地址可能长期停留在索引里。所以更稳妥的顺序是,先让页面能被抓取并给出 canonical 或 noindex,等索引状态收敛后,再考虑是否屏蔽。对已经确认无用的会话参数,如果它来自站内链接,最好直接改掉链接生成逻辑。

把规范版本放进 sitemap

sitemap 是提示,不是白名单。只提交不带参数的规范地址,能减少搜索引擎把参数版本当成独立页面的机会。但前提是站内链接也别到处撒参数地址,否则 sitemap 一边收敛、内链一边发散,效果会互相抵消。

追踪参数单独处理

推广链接上的 utm 通常不该被索引。可以在服务器端把它重写到干净地址,或者用 canonical 统一指向干净版本。如果站点有统一的链接生成规则,从源头去掉参数是最省事的。

判断一个参数页该不该留,可以问两个问题:它有没有独立的内容,有没有独立的搜索需求?如果答案都是否,那它大概率只是系统副产品。

怎么确认收口有没有生效

不要只看改动当天。可以按下面的顺序观察:

  • 抓取日志里带参数的访问占比是否下降,规范页面是否拿到了更多抓取。
  • 索引覆盖率报告中,带参数地址的数量是否在回落;回落通常以周为单位。
  • 站内搜索几个典型参数组合,看留下的那一版是否稳定。
  • 核对 sitemap、内链、canonical 是否指向同一个版本,避免信号互相打架。

一些容易忽略的细节

  • 参数顺序和大小写不同的地址(?a=1&b=2 与 ?b=2&a=1)也可能被当成不同 URL,规范做法是固定参数顺序和大小写。
  • 分页不要随便 noindex,它和参数页的处理逻辑不同,通常用自指 canonical 加清晰的翻页链接更合适。
  • 如果某个参数页确实带来流量,别急着清掉,先确认它是内容页还是列表页,再决定留还是并。
  • 参数治理不是一次性的,新功能上线、活动页改版都可能重新产生参数地址,定期看一眼抓取日志比事后补救省力。

参数 URL 的问题很少能靠一条规则解决。更现实的做法是:把参数按用途分好类,对每类给出明确的信号,然后耐心观察索引缓慢收敛。这个过程的节奏由搜索引擎决定,站点能做的是把信号理顺,而不是催收录。