站内一旦有了筛选、排序、分页、追踪等参数,URL 的数量往往会成倍膨胀。这些页面有的确实对用户有用,有的只是同一批内容的另一种排列。放任不管,蜘蛛会把大量配额花在相似页面上;一刀切屏蔽,又可能把真正有价值的入口挡在外面。关键在于先给参数分类,再决定放还是收。
参数 URL 的三种来源
先把站内出现的参数按来源过一遍,处理方式差别很大。
- 功能性参数:分页、排序、每页条数、视图切换。这类参数改变的是同一批内容的排列组合,内容主体基本重合。
- 筛选参数:价格区间、品牌、地区、属性组合。单一维度且组合数量可控时,往往能形成有独立价值的落地页;维度一叠加,就容易生成大量低差异页面。
- 追踪与营销参数:来源渠道、活动标记、会话标识、分享参数。它们对页面内容没有任何影响,属于典型的重复 URL 来源。
判断一个参数页该不该收录
不必纠结技术细节,先问三个问题:这个 URL 直接给用户访问时,页面能否正常展示对应结果?搜索结果里已经有同类页面在占位吗?它的内容能否用一句话说清和其它页面的区别?三个答案都是肯定的,才有讨论收录的意义。任何一个含糊,优先考虑收敛。
可以放开的典型情况
- 单一筛选维度、且该维度的组合数量有限,例如按地区划分的服务页。
- 有稳定搜索需求,页面标题和正文能对应到具体意图。
- 页面能从站内链接正常到达,而不是只能靠参数拼出来。
建议收紧的典型情况
- 多维度叠加产生的组合页,内容大量雷同。
- 排序、每页条数、视图模式等纯展示层参数。
- 带追踪参数、会话参数的地址。
- 筛选结果为空或结果极少的页面。
收紧的几种做法与取舍
常见手段各有副作用,用之前想清楚目的是减少抓取还是减少索引。
- canonical 指向主版本:适合内容确实重合、但希望保留用户访问的情况。它是提示而非强制,要保证指向的地址本身可访问、内容一致。
- robots.txt 屏蔽参数路径:能明显减少抓取,但蜘蛛无法再看到页面上的 canonical 等信号,索引里已有的旧地址也不会因此自动消失。
- 页面级 noindex:需要蜘蛛能抓到页面才能生效,适合结果页、组合页这类能访问但不希望进索引的场景。
- 链接层面控制:站内入口只指向默认版本,筛选链接用可点击但不被跟进的写法,从源头上减少参数 URL 被发现的机会。
- 让筛选结果由 JS 驱动:减少服务端生成的独立 URL,但要注意内容对用户可见、对蜘蛛也尽可能可读。
参数处理没有万能配置。同一个站点里,分页参数和营销参数的处理方式就应该不同,定期回看参数列表比一次性设置更重要。
放开收录时要补的几件事
- 标题、描述、H1 要能反映该参数页的具体范围,不要所有筛选页共用一个模板文案。
- 结果为空或结果过少时,返回合适的状态码而不是一个空白页。
- 分页之间用规范的链接关系串联,避免同一页通过多种参数组合反复出现。
- 把这类页面放进站点地图时,只放你确实希望被索引的那些地址。
一条可执行的自查顺序
- 导出近期蜘蛛日志里带参数的 URL,按参数名归组,看抓取量集中在哪几类。
- 用站点查询或索引状态工具,确认这些参数页里有多少已经进了索引。
- 对照上文分类,给每一组参数打上「放开/合并/屏蔽」的标签。
- 先处理追踪参数和多维组合页,观察一到两周的抓取结构变化,再动筛选主维度。
- 记录每次调整的时间和范围,避免多套规则互相覆盖后说不清是哪一步起的作用。
参数 URL 的管理,本质是给蜘蛛划出一条清晰的路径:哪些地址值得花时间,哪些只是同一批内容的另一种排列。把这件事定期梳理,抓取预算的分配和索引里的页面构成都会更可控。