商品列表、文章归档、房源检索这类页面,往往会带上一串筛选参数:颜色、尺码、价格区间、排序方式、每页条数、分页码。单个参数看起来无害,但参数一旦可以自由组合,URL 数量就是乘法关系,几千条内容能膨胀出几十万条地址。这些地址大多由程序即时生成,内容高度相似,却会实打实地占用抓取资源,也会拉低索引里页面的整体质量。
参数 URL 为什么会失控
失控通常不是因为参数本身,而是因为几个默认设置:
- 排序、每页条数、来源追踪等参数没有固定,用户点一下就是一个新 URL;
- 同一批结果有多条路径可达,例如 /list?color=red 与 /list/red 同时存在;
- 筛选条件为空时依然生成带参数的地址,内容和主列表页完全一致。
结果就是:真正有价值的页面没几条,等待被抓取的地址却排到了几个月之后。
决定放开还是收紧前,先看三件事
一、这批参数有没有独立搜索需求
有些筛选组合本身就是用户会主动搜索的词,例如「某品牌 + 某型号 + 二手」。这类页面存在被搜索命中的可能,值得单独对待;而纯粹由排序、页码、追踪参数产生的地址,几乎不会有独立需求。
二、结果集是不是真的不同
把参数页打开,和主列表页对比前 20 条结果。如果差异很小,或者只是顺序变了,那它在索引里就是重复内容;如果筛选后剩下的是一批完全不同的条目,页面本身是有信息量的。
三、它有没有被主动暴露
只出现在筛选交互里、任何静态链接都到不了的参数页,本身就是孤岛。反过来,如果站内导航、文章正文里大量指向参数 URL,等于在告诉搜索引擎这些地址很重要。
处理顺序:从宽到严
- 统一参数形式。把排序、每页条数、追踪参数固定为默认值,并把等价地址收敛到一条主地址上。
- 只保留有内容的参数组合。筛选后结果为零或极少的组合,返回 404 或跳回主列表,不要返回一个空壳页面。
- 用 canonical 指向规范版本。注意 canonical 是建议而非命令,而且被 robots.txt 屏蔽的页面,搜索引擎读不到它的 canonical。
- 对确认无价值但仍需服务用户的页面加 noindex。这类页面可以继续给人看,只是不进入索引。
- sitemap 只提交主干地址。把参数 URL 一并塞进站点地图,等于主动扩大抓取队列。
- 用日志和数据验证。观察参数 URL 的抓取占比是否下降、规范地址的抓取是否上升,再决定要不要继续收紧。
几个容易踩的坑
- 用 robots.txt 屏蔽参数页,同时又指望它的 canonical 生效——被屏蔽后 canonical 基本读不到,这两件事要分开做。
- 把分页全部 noindex,导致深层内容失去发现路径。
- noindex 与 robots.txt 屏蔽同时使用,标签同样读不到,判断依据也会丢失。
- 只处理了 PC 端的参数,移动端模板仍在生成另一套地址。
参数页不是必须全部屏蔽,也不是全部放开。关键是让每一个进入索引的地址,都有它单独存在的理由。
给参数页设一个名额预算
比较实用的做法是设定上限,例如「允许被索引的参数页不超过站点索引量的 5%」,然后按月抽查:随机抽 20 条已收录的参数 URL,看它们的访问量、转化以及是否在搜索结果中出现。长期没有表现、内容又与其他页面高度重合的,就往下压一档处理。
参数治理不会让收录立刻变好,但能减少无谓的抓取消耗,把机会让给真正需要被发现的页面。调整之后建议至少观察一个完整的抓取周期再判断效果,避免频繁改方向。