站点运营

站点运营:URL 参数与筛选条件自查,别让同一批内容变成无数个地址

站内带参数的地址常常比真实内容多出好几倍,抓取预算被悄悄分散。本文整理参数的常见来源、该管与可以放过的判断标准,以及筛选页、跟踪参数的处理顺序和自查清单,帮你把地址数量收回到可控范围。

站点运营

站点运营:URL 参数与筛选条件自查,别让同一批内容变成无数个地址

站点跑一段时间后,URL 数量往往会比实际内容多出好几倍。多出来的那部分通常不是新页面,而是同一批内容带着不同参数被反复访问。对蜘蛛来说,这些地址看起来彼此独立,抓取资源就这样一点点被分散掉。

参数都从哪里来

先别急着封禁,把来源理清楚更省事。常见的几类:

  • 分页参数:?page=2、?p=3 这类。
  • 排序参数:?sort=price、?order=desc。
  • 筛选与属性:?color=red&size=40,组合起来数量会迅速膨胀。
  • 跟踪参数:utm_source、from、ref、share 等,多数对内容没有影响。
  • 会话与临时参数:sessionid、sid、ts,每次访问都可能不同。
  • 功能型参数:?print=1、?preview=1 这类输出变体。

什么时候该管,什么时候可以放

不是所有参数都要处理。判断标准很简单:这个参数是否改变了页面主体内容。改变了,比如筛选出特定价格区间的商品列表,它就是一个有意义的地址;没改变,比如只带了一串跟踪码,那它就是重复地址。

对后者,处理顺序建议是:能去掉参数链接就去掉,去不掉就用 canonical 指向无参数版本,再不行才考虑在 robots.txt 里屏蔽这类参数抓取。

自查清单

  • 从服务器日志里抽出带问号的访问记录,按参数名统计出现频次,排个序。
  • 确认站内链接是否在主动生成跟踪参数,常见于模板、分享按钮、广告位。
  • 检查筛选页有没有出口,会不会被顺着链接无限组合下去。
  • 确认带参数页面上的 canonical 指向了正确的主版本,并且是绝对地址。
  • 检查站点地图里是否混入了带参数的地址。
  • 确认参数屏蔽规则没有误伤正文页。
  • 看搜索后台的抓取统计,观察参数类地址的抓取占比是否在下降。

筛选页的常见做法

筛选组合是最容易失控的部分,可以按下面几条控制:

  1. 只对少数高价值筛选组合生成可抓取链接,其余用按钮或脚本形式呈现。
  2. 限制同时可选的筛选维度数量,避免出现成倍相乘的组合。
  3. 给筛选结果页设定分页上限,别让加载更多一直通向更深的地址。
  4. 没有结果的空组合,返回合适的状态码,不要返回一个 200 的空列表页。

跟踪参数怎么统一

站内链接尽量别带 utm 这类参数,它们留给站外投放就够了。如果确实必须带,建议统一参数名与书写顺序,并在服务端做一次归一化:同名参数只保留第一个值,顺序固定,空值直接剔除。这样即使参数存在,地址的变体数量也会明显收敛。

判断标准不是“这个地址好不好看”,而是“它和主版本相比,用户看到的内容到底一不一样”。

做完之后怎么观察

调整参数策略不会立刻见效。更稳妥的做法是改完之后隔两到四周再看一次日志和抓取统计,比较参数类地址与主版本地址的抓取次数有没有变化。如果屏蔽之后主版本的抓取量不升反降,先回头检查是不是误伤了有用的筛选页。

参数本身不是问题,失控的参数才是。把它当成站点结构的一部分来管理,比事后靠一条条规则打补丁要省事得多。