站内搜索结果页、筛选页、排序页被索引,是不少站点索引量虚高的常见来源。这类 URL 由同一套模板批量生成,参数组合多,一旦被大量收录,既会让站内链接分散到低价值地址上,也会让索引覆盖率的数据变得很难解读。动手处理之前,先要判断哪些该留、哪些该去,而不是一律屏蔽。
第一步:把参数页按用途分成三类
- 有独立搜索需求的页面:比如品牌词、型号词、热门组合词的站内结果页,本身可能承接真实搜索流量,值得单独评估。
- 站内导航性质的页面:列表页的排序方式、每页条数、视图切换等,对用户价值低,通常不该出现在索引里。
- 纯技术参数:跟踪参数、会话标识、回传参数等,对内容没有任何影响,属于典型的重复地址。
分类之后再谈处理手段。否则很容易把本来有流量的筛选页一起 noindex,丢掉已有的访问来源。
第二步:确认这些 URL 到底有没有被收录
- 用站点查询做粗略观察,它样本偏差大,只当参考,不作为结论。
- 用 URL 检查类工具逐条查看几个有代表性的地址,确认当前状态与规范的收录归属。
- 从服务器日志里筛出带参数的请求,看蜘蛛的抓取频次和返回码,判断它是否在反复发现这些地址。
- 直接在结果页里搜几个典型参数组合,看是否真的出现。
三类数据交叉看,比只盯着索引量总数有用得多。总量变化往往同时受新页面发布、重复地址涌入、低质页清理等多重因素影响。
第三步:按页面类型选择处理方式
不该被收录的
- 页面级 noindex,让蜘蛛读到并据此移除。
- canonical 指向规范列表页,用于内容高度重合的排序参数。
- 内链中去掉这些参数组合,减少新的发现路径。
- 站点地图里不包含这类地址。
需要留意 robots.txt 与 noindex 的先后关系:一旦用 robots.txt 屏蔽了抓取,页面上的 noindex 就无法被读到,已收录的地址反而可能长期留在索引里。让已收录页面退出的常规做法,是先允许抓取并给出 noindex,确认移除之后再考虑屏蔽抓取。
值得保留的
保留的搜索页或筛选页,应有稳定的标题、可被索引的实质内容,以及相对唯一的 URL 结构。要避免同一个结果集由多组参数生成多个可索引地址,否则又回到重复地址的老问题。
分页与排序
排序类参数通常只是把同一批内容换个顺序,与默认列表高度重合,一般归并到默认列表页。分页则是不同内容的集合,若确实不希望收录,可用 noindex,follow 的方式保留链接传递,让蜘蛛仍能顺着走到更深的页面。
第四步:改动之后的核对项
这类改动不会立刻反映出来,通常需要几周时间。可以按下面几项跟踪:
- 索引量的变化幅度,以及减少的是不是那批参数地址。
- 服务器日志里参数 URL 的抓取频次是否下降,抓取是否转移到目标页面。
- 保留下来的搜索页与典型列表页的收录状态是否稳定。
不要因为短期索引量下降就急着回退改动。先确认下降的究竟是低价值参数页,还是被误伤的正常页面,再做决定。
常见误操作
- 用 robots.txt 全站屏蔽所有带问号的地址,连正常分页一起挡掉。
- 只给参数页加了 canonical,却没有收敛站内链接,蜘蛛仍会不断发现并抓取。
- 把有真实搜索需求的筛选页也一起 noindex,等于主动放弃已有流量。
- 参数页与主列表页内容几乎一样,却各自保留可索引状态,形成站内自我重复。
整体思路并不复杂:先把参数页按用途分类,再决定去留,最后让 robots、noindex、canonical、内链和站点地图几个信号指向同一个结论。信号一致,蜘蛛和索引才容易给出符合预期的结果。