分面导航(筛选、排序、价格区间、品牌多选)对用户是好东西,但对蜘蛛来说,它是一台 URL 生产机。同一批商品,勾选不同组合就能生成成百上千个地址。如果没有约束,蜘蛛顺着这些链接一层层点下去,抓取路径会迅速分叉,真正需要被发现的详情页反而排不上队。
一、蜘蛛为什么容易在筛选页里迷路
筛选页本身不是坏页面,它的风险在于可组合的数量。三个筛选维度各十来个取值,两两组合就是几百个地址,再加上排序参数、每页条数参数,实际生成的 URL 数量会远远超过站点的内容量。
蜘蛛爬行时并不理解「这些页面内容高度相似」,它只看到一条条可点的新链接。于是通常会出现两个现象:
- 抓取额度被大量相似列表页占掉,详情页反而抓得少;
- 抓取路径越走越深,同一件商品从几十个不同入口被反复抓到。
二、路径分叉之后会发生什么
当同一批内容能从多个参数入口到达,搜索引擎需要自己做归一化判断。这个过程里,抓取资源和页面权重都被摊薄,页面即使被抓到,也可能被当作重复内容处理。
运营侧的判断标准很简单:一个 URL 如果用户几乎不会通过它看到不一样的内容,它就不值得被蜘蛛当成一条独立路径。
需要留意的是,单纯靠 robots.txt 屏蔽某些参数,只能挡住「抓取」,挡不住「发现」。链接只要出现在页面上,蜘蛛仍可能记录下这个地址,只是暂时不去抓。所以更彻底的做法是从内链源头减少这类地址的产生。
三、怎么把抓取路径收敛回来
1. 限制可组合的参数
常见的做法是只放开「单维度 + 有限取值」的筛选,比如品牌单选、价格区间固定几档;多选组合不生成静态链接,改成前端交互后置。这样页面依然好用,但可爬地址的数量会明显下降。
2. 内链只指向规范版本
- 列表页默认排序不拼参数,或统一成同一个规范地址;
- 筛选结果改用按钮交互,减少可爬链接;
- 详情页的面包屑回到分类主入口,而不是回到某个筛选组合页。
这样做的目的,是把蜘蛛的路径收敛到「首页 → 分类 → 详情」这条主干上,减少分支数量。
3. 用 Sitemap 补主干
Sitemap 适合放重要的详情页和分类首层,不适合堆放参数组合页。把主干地址整理干净,等于给蜘蛛提供一条不依赖筛选操作的路径。
四、验证:日志里看什么
调整之后,用服务器日志确认效果最直接:
- 看详情页的抓取次数是否上升,参数页的抓取次数是否回落;
- 看同一批详情页的入口数量是否减少,路径是否更集中;
- 看新上架内容从「发现」到「被抓」的间隔有没有缩短。
如果参数页的抓取量降下来了,但详情页并没有涨,说明额度可能被其他低价值页面接走了,需要继续往下排查。
五、几点提醒
收敛路径不等于一刀切屏蔽所有参数。有些筛选页确实能满足搜索需求,也能带来访问,这类页面可以保留,但要控制数量,并保证内容和主列表有实质差异。判断依据始终是:这个地址对用户有没有独立价值,而不是蜘蛛喜不喜欢。