网站收录

筛选与排序参数生成的 URL:哪些该让蜘蛛跟,哪些该收敛

站内筛选、排序、分页和追踪参数会让 URL 数量成倍增长。本文把参数按来源分成功能、筛选、追踪三类,说明哪些参数页值得放开收录、哪些应当收敛,并比较 canonical、robots、noindex、链接控制几种做法的取舍,最后附一条从蜘蛛日志到规则调整的自查顺序。

网站收录

筛选与排序参数生成的 URL:哪些该让蜘蛛跟,哪些该收敛

站内一旦有了筛选、排序、分页、追踪等参数,URL 的数量往往会成倍膨胀。这些页面有的确实对用户有用,有的只是同一批内容的另一种排列。放任不管,蜘蛛会把大量配额花在相似页面上;一刀切屏蔽,又可能把真正有价值的入口挡在外面。关键在于先给参数分类,再决定放还是收。

参数 URL 的三种来源

先把站内出现的参数按来源过一遍,处理方式差别很大。

  • 功能性参数:分页、排序、每页条数、视图切换。这类参数改变的是同一批内容的排列组合,内容主体基本重合。
  • 筛选参数:价格区间、品牌、地区、属性组合。单一维度且组合数量可控时,往往能形成有独立价值的落地页;维度一叠加,就容易生成大量低差异页面。
  • 追踪与营销参数:来源渠道、活动标记、会话标识、分享参数。它们对页面内容没有任何影响,属于典型的重复 URL 来源。

判断一个参数页该不该收录

不必纠结技术细节,先问三个问题:这个 URL 直接给用户访问时,页面能否正常展示对应结果?搜索结果里已经有同类页面在占位吗?它的内容能否用一句话说清和其它页面的区别?三个答案都是肯定的,才有讨论收录的意义。任何一个含糊,优先考虑收敛。

可以放开的典型情况

  • 单一筛选维度、且该维度的组合数量有限,例如按地区划分的服务页。
  • 有稳定搜索需求,页面标题和正文能对应到具体意图。
  • 页面能从站内链接正常到达,而不是只能靠参数拼出来。

建议收紧的典型情况

  • 多维度叠加产生的组合页,内容大量雷同。
  • 排序、每页条数、视图模式等纯展示层参数。
  • 带追踪参数、会话参数的地址。
  • 筛选结果为空或结果极少的页面。

收紧的几种做法与取舍

常见手段各有副作用,用之前想清楚目的是减少抓取还是减少索引。

  1. canonical 指向主版本:适合内容确实重合、但希望保留用户访问的情况。它是提示而非强制,要保证指向的地址本身可访问、内容一致。
  2. robots.txt 屏蔽参数路径:能明显减少抓取,但蜘蛛无法再看到页面上的 canonical 等信号,索引里已有的旧地址也不会因此自动消失。
  3. 页面级 noindex:需要蜘蛛能抓到页面才能生效,适合结果页、组合页这类能访问但不希望进索引的场景。
  4. 链接层面控制:站内入口只指向默认版本,筛选链接用可点击但不被跟进的写法,从源头上减少参数 URL 被发现的机会。
  5. 让筛选结果由 JS 驱动:减少服务端生成的独立 URL,但要注意内容对用户可见、对蜘蛛也尽可能可读。
参数处理没有万能配置。同一个站点里,分页参数和营销参数的处理方式就应该不同,定期回看参数列表比一次性设置更重要。

放开收录时要补的几件事

  • 标题、描述、H1 要能反映该参数页的具体范围,不要所有筛选页共用一个模板文案。
  • 结果为空或结果过少时,返回合适的状态码而不是一个空白页。
  • 分页之间用规范的链接关系串联,避免同一页通过多种参数组合反复出现。
  • 把这类页面放进站点地图时,只放你确实希望被索引的那些地址。

一条可执行的自查顺序

  1. 导出近期蜘蛛日志里带参数的 URL,按参数名归组,看抓取量集中在哪几类。
  2. 用站点查询或索引状态工具,确认这些参数页里有多少已经进了索引。
  3. 对照上文分类,给每一组参数打上「放开/合并/屏蔽」的标签。
  4. 先处理追踪参数和多维组合页,观察一到两周的抓取结构变化,再动筛选主维度。
  5. 记录每次调整的时间和范围,避免多套规则互相覆盖后说不清是哪一步起的作用。

参数 URL 的管理,本质是给蜘蛛划出一条清晰的路径:哪些地址值得花时间,哪些只是同一批内容的另一种排列。把这件事定期梳理,抓取预算的分配和索引里的页面构成都会更可控。