站内筛选、排序、站内搜索,是用户用得最多的功能之一,也是站点最容易产生大量 URL 的地方。颜色、尺寸、价格区间、排序方式,任意两三个条件组合,就能生成成百上千条地址。这些页面大多内容相似、价值有限,却会实实在在占用抓取时间和服务器资源。下面这份自查清单,帮你在不牺牲用户体验的前提下,把参数型 URL 收敛到一个可控范围。
参数型 URL 为什么会失控
多数情况下不是有人故意制造,而是功能自然生长的结果。前端为了保留筛选状态,把条件写进查询字符串;站内搜索把关键词、页码、排序都拼进链接;分页与筛选叠加后,链接数量呈指数增长。
- 筛选条件的可选值来自数据库,条目越多,组合越多;
- 排序、视图切换、每页条数这类参数,对页面内容没有实质影响;
- 站内搜索结果页没有固定内容,却能被外部链接和站内链接反复发现;
- 会话 ID、跟踪参数被误当作页面参数长期保留下来。
第一步:先摸清现状
不要凭印象判断。打开服务器访问日志,按路径去重后统计带问号的请求占比,再抽样看哪些参数出现频率最高。同时用搜索指令或站长平台工具,看带参数的 URL 实际被收录了多少。两个数字放在一起,基本能判断问题规模。
几个观察点
- 带参 URL 的抓取量占整站的比例;
- 这些请求返回的状态码分布,是否存在大量空结果页;
- 用户真实从带参页面进入并停留的比例。
第二步:分类处理,而不是一刀切
把所有参数都屏蔽掉,往往会连用户正常的筛选入口一起砍掉。更稳的做法是分三类处理。
- 有价值且内容稳定:比如固定的品牌页、品类筛选页,可以作为独立页面维护,给出规范的标题和描述,并让它进入内链体系。
- 对内容无影响:排序、视图、每页条数、跟踪参数等,建议统一规范到不带参的地址,或直接在 robots 中限制抓取。
- 无限组合:多条件叠加、任意关键词的站内搜索,通常应限制抓取,并避免被站内链接大量暴露。
第三步:站内搜索结果页怎么处理
站内搜索页对用户有帮助,但对搜索引擎来说往往重复且易变。常见的处理方式有几种:
- 在 robots.txt 中限制搜索路径抓取,同时确认重要内容不依赖该路径才能被发现;
- 给搜索页加上 noindex 类指令,避免进入索引;
- 搜索结果页内的链接使用 nofollow,减少顺着关键词组合无限扩展;
- 如果确实有稳定的热门查询词,可以做成独立专题页,用静态路径承载。
容易踩的坑
- 只加 robots 不加 noindex:已经收录的带参页面不会自动消失,仍可能出现在结果里。
- 规范标签写反:把带参版本当作规范地址,等于主动放大问题。
- 筛选链接全靠 JS 拼接且无兜底:用户能用,蜘蛛也可能顺着爬,但状态码和内容不可控。
- 分页与筛选叠加:这类页面内容重复度高,建议限制抓取深度。
落地节奏
先处理量最大、价值最低的那一类参数,观察一到两周的日志变化,再处理下一类。每次改动后回看三项指标:抓取总量是否下降、重要页面的抓取是否上升、用户从筛选入口的转化是否受影响。参数治理不是一次性的清理,而是跟着功能迭代持续维护的事。
判断标准很简单:这个带参页面,用户会主动收藏或分享吗?不会的话,它大概率不需要被索引。