分面导航的路径为什么会发散
分类页上常见的筛选、排序、视图切换,大多是带参数的链接。颜色、尺寸、价格区间、排序方式、每页条数、页码,每一种选择都会生成一条新的 URL。用户点几下就走的路径,对蜘蛛来说却是一张可以不断延伸的链接网:每进入一个筛选组合,页面里又会出现新的组合链接,路径像树枝一样持续分叉。
问题不在参数本身,而在于这些路径上的页面大多内容高度重合,只是排列顺序或子集不同。蜘蛛把时间花在这里,真正需要更新的详情页和栏目页就排到了后面。
先判断绕圈的程度
不用急着改结构,先翻日志。
- 带参数的 URL 占蜘蛛总请求的比例是多少,如果长期高于三成,就值得处理。
- 同一批参数 URL 被反复抓取的频率,是否明显高于正文页。
- 站点地图里没有的参数 URL,却在日志里大量出现,说明是内链把它引过去的。
- 抓取统计中“已发现未抓取”的数量,是否集中在参数形态的地址上。
这几项对不上时,先按参数名分组统计一遍,通常能看出是哪几个参数在制造分叉,比笼统地说“抓取不够”有用得多。
把可抓取的路径收敛成几条主干
区分哪些筛选组合值得保留
不是所有组合都有独立价值。价格区间、排序方式、每页条数这类,一般不需要蜘蛛逐条走;品牌、品类、地区这类有独立搜索需求的组合,可以考虑留下。判断标准可以简单些:这个组合有没有人真的用关键词搜过来,或者有没有自己独立的内容。
让链接形态本身干净一点
- 统一参数的书写顺序,避免同一组合出现多种写法。
- 页面上用按钮加脚本触发筛选,而不是全部铺成 a 标签,蜘蛛就不会把每个组合都当成一条可走的路。
- 需要保留的组合,给出唯一的规范地址,其他写法统一指向它。
主干路径要讲清楚
分面页之外,站点最好有一组稳定的主干:首页到一级栏目,再到二级栏目,最后是详情页。这层路径不依赖参数,也不依赖脚本,是蜘蛛理解站点结构的基础。分面导航可以挂在主干旁边,但不宜让它成为进入内容的主要通道。
收敛路径的目标不是让蜘蛛走得少,而是让它走在对的地方。少走一些重复的筛选组合,省下来的抓取额度通常会更自然地落到正文页上。
几个容易踩的坑
- 用 robots.txt 一刀切屏蔽全部参数,可能连有独立价值的组合页也一起挡掉,需要先列清单再决定。
- 屏蔽只是不抓取,链接仍会被发现。如果这类 URL 数量巨大,最好同时从内链上减少暴露。
- 把参数页全部规范到无参数地址时,要确认两边正文确实一致,否则容易误判。
- 改完马上盯排名或收录,往往会失望。这类调整通常先体现在抓取分布上,要几周日志才看得清。
调整之后盯哪几个数
重点看三件事:蜘蛛请求里参数 URL 的占比是否下降;正文页和栏目页的抓取次数、抓取深度是否上升;服务器错误率有没有因为路径变化而波动。如果参数请求降下来了,正文页抓取却没起来,多半说明主干路径本身还有断点,得回去看内链和站点地图,而不是继续在参数上做文章。