站点里数量最多的一类 URL,往往不是文章页,而是翻页、筛选、排序组合出来的页面。它们对用户有用,但是否值得进索引,是另一个问题。处理得好,能帮蜘蛛发现新内容;处理不好,会让索引里堆满内容高度相似的地址。
先把三类页面分开看
虽然都带参数,但它们的性质不同,处理方式也不该一样。
- 翻页:/list?page=2 这类,内容随页码变化,通常越往后价值越低。
- 筛选:按分类、品牌、价格区间过滤,部分筛选组合有真实搜索需求。
- 排序:按时间、销量、价格排序,同一批内容换个顺序,几乎不产生新信息。
判断的核心:这个地址有没有独立搜索需求
可以拿一个简单的问题去问:用户会不会在搜索框里输入对应的词?如果一个页面的意图完全能被上一级页面覆盖,它进索引后大概率只是与主页面竞争,而不是带来额外流量。
筛选页要特别小心。某些筛选组合确实对应清晰的查询意图,比如「城市 + 户型」,这类页面可以考虑保留;而三四个条件叠加出来的长尾组合,往往是数量爆炸的来源。
让它们进索引,代价是什么
主要代价不在服务器,而在抓取预算和索引质量。
- 蜘蛛在翻页和筛选组合上花费的抓取次数,本可以用在真正需要更新的内容页上。
- 索引里混入大量近似页面后,去重和选主版本的过程会更频繁,容易出现「收录的是哪一版」这种难以预测的情况。
- 站内链接权重被稀释,重要页面的入口可能被埋在几十个组合地址之后。
几种常见做法和适用场景
- 翻页保留、但控制深度:前几页可抓可取,靠后的页码通过分页链接层级自然收敛。
- 排序参数统一处理:排序只改变展示顺序,不适合作为独立页面,通常可以用参数规范或 robots 规则统一归拢到一个地址。
- 筛选按需求分级:有搜索需求的组合保留并加自指 canonical,无需求的组合用 noindex 或屏蔽抓取。
- 列表页本身做好入口:列表页的价值更多在于把内容页暴露给蜘蛛,而不是自己被收录。
判断标准可以简化成一句话:这个地址如果被收录,会不会给用户带来上一级页面给不了的东西。答案是否定的时候,留着它做链接通道就够了。
动手之前,先看两组数据
第一组是抓取日志里这类 URL 占的比例,第二组是它们在索引里的数量和带来的点击。如果抓取占比很高、点击接近零,就值得重新分配抓取预算;反过来,如果某个筛选页确实稳定带来流量,就不该一刀切地屏蔽。
处理完记得观察后续变化。规则改完之后,索引里的旧地址不会立刻消失,通常会经历一段逐步替换的过程,短期内数量上下浮动属于正常现象,重点是看趋势而不是看某一天的数字。