站点只要带上筛选、排序、对比这类交互,URL 的数量就会以参数组合的方式成倍膨胀。搜索蜘蛛顺着页面上的链接一路爬下去,很容易把大量带参数的地址当成彼此独立的入口,抓取次数被摊薄,真正需要更新的正文页反而排在后面。下面按“为什么会变多—怎么量化—怎么收敛—怎么观察”的顺序梳理一遍。
参数入口变多的常见来源
- 排序参数:列表页加上 sort、order 之类的参数,同一批内容会生成若干套地址,内容完全一致,只是顺序不同。
- 筛选参数:价格区间、品牌、属性标签可以多选,组合数量随选项增长呈几何级放大,其中大部分页面只有一两条结果。
- 分页与参数叠加:带筛选条件后再翻页,参数被逐层累加,同一个详情页可能被多条拼装路径指向。
- 追踪参数:推广链接、站内推荐位自带的 utm、ref、from 等参数,如果被站内链接直接复制使用,会额外造出一批入口。
这些地址本身未必有错,问题在于它们大多内容重复、更新极少,却和核心内容共享同一份抓取额度。
先用日志量化参数入口占比
动手改结构之前,建议从访问日志里拿到几个数字,避免凭感觉下判断:
- 统计蜘蛛请求中带问号参数的 URL 占比,以及这批请求落在多少个不同的参数名上。
- 按参数名分组,看哪些参数被抓取的次数远高于其内容价值,例如纯排序参数。
- 对比参数页与无参主版本的抓取比例,判断抓取重心是否已经偏向参数页。
- 抽样查看参数页返回的状态码与响应体积,确认是否存在大量近似重复的响应体。
如果带参 URL 的抓取占比明显高于它实际带来的价值,就可以进入收敛环节。
收敛手段与取舍
canonical 与内链指向
参数页可以保留可用,但对多套排序、筛选结果统一用 canonical 指回无参主版本;站内链接尽量只暴露主版本,排序、筛选按钮改成点击后再生成参数,而不是在 HTML 里直接铺满链接标签。这样既保住功能,也减少入口数量。
robots.txt 要慎用
直接屏蔽某个参数看似干脆,但 robots.txt 只约束抓取、不约束收录。若某个带参地址已经被收录,屏蔽后蜘蛛无法读取页面上的 canonical,反而可能长期留存旧快照。对已收录的地址,优先考虑返回 301 到主版本或补充 noindex,而不是简单堵住。
sitemap 只放主版本
站点地图里只列出无参的规范地址,把参数页交给内链自然发现。让 sitemap 与内链给出同一套地址,抓取路径会更集中。
观察收敛效果
调整后不要立刻下结论,抓取节奏的变化通常需要数周。可以按周对比几个指标:带参 URL 的抓取请求数、主版本页面的抓取次数、日志中重复路径的条数。若带参抓取占比下降而主版本上升,方向基本正确;若主版本没有变化,则要回头检查 canonical 是否被正确读取、内链是否真的只指向主版本。
参数收敛的目标不是让蜘蛛少抓,而是让有限的抓取次数落在内容会变、值得被更新的地址上。任何屏蔽动作之前,先确认目标地址是否已经被收录,避免把入口和退路一起关掉。
另一条稳妥的路径是把参数治理纳入日常发布检查:新增筛选或排序功能时,同步确认 canonical、内链与 sitemap 的表现,减少入口膨胀在后期才被发现的情况。