打开索引覆盖率报告或直接做一次 site 查询,看到一批带问号的地址:?q=、?sort=、?filter=、?page= 层层叠加。这些多数来自站内搜索框和各种筛选控件。它们能被收录,通常不是搜索引擎主动造出来的,而是站点自己把可抓取的入口放了出去。
先看这些地址是怎么产生的
按生成方式拆开,处理思路会清晰很多:
- 站内搜索结果页:用户站内搜索后跳转到的地址,只要链接被输出到页面上,就可能被抓取。
- 排序与筛选参数:列表页的排序切换、多条件筛选,每变一次就生成一个新地址。
- 分页与筛选叠加:筛选条件再加页码,数量按乘法增长。
- 跟踪与会话参数:来源标记、临时会话 ID 挂在地址后面。
这类页面和尾斜杠、大小写那种情况不一样。尾斜杠是同一个地址的不同写法,而参数页地址确实不同、内容也略有区别,只是主题高度近似、数量没有上限。也正因如此,它们很容易被当成独立页面进入索引。
判断哪些该留、哪些该收
不是所有参数页都该清掉。判断标准其实很简单:这个组合有没有人真的会搜,有没有独立的展示价值。
- 有明确需求的核心筛选组合,可以考虑保留,甚至做成静态化的固定入口。
- 由用户随意输入生成的搜索结果页,一般没有留的必要。
- 纯排序、纯跟踪参数,通常只影响展示顺序,不影响内容主体。
处理顺序:从生成源头到索引状态
- 先断掉自动生成。站内搜索结果页默认加 noindex,不要让它成为可长期抓取的公开页面。
- 控制内链和站点地图。只要页面上的链接不指向这些组合,站点地图也不提交,抓取压力就会小很多。这一步比后面任何补救都有效。
- 再选抓取或索引手段,并注意冲突。robots.txt 屏蔽的是抓取,不能保证把已有条目移出索引;而被屏蔽之后,抓取工具看不到页面上的 noindex,索引里的条目可能长期保留、只剩一个没有摘要的地址。要移除索引,优先用可以抓取的 noindex。
- 给确有价值的多参数页面指定规范地址。canonical 指向对应的主列表页,注意目标页本身必须可抓取、可索引,否则信号会落空。
- 最后处理已经收录的条目。多数情况等重新抓取后自然收敛,量很少时可以用移除工具,但不要靠它解决结构性问题。
抓取控制和索引控制是两回事。屏蔽抓取往往只是让问题从报告里看不见,而不是真的解决。
收敛之后怎么验证
改动生效有滞后,观察周期按周看比较现实。可以对照三处:索引报告里相关地址的数量趋势、site 查询的结果、服务器日志里这些地址的抓取频次。三条线索方向一致,说明收敛在起作用。
它还会再长出来
参数页不是清一次就结束的事。新的筛选维度、新的排序方式、新的营销跟踪参数,都会重新生成一批地址。更稳的做法是在模板和链接输出层面控制:默认不把可组合的参数链接渲染成可抓取的 a 标签,新增参数上线前先确认它到底该不该被索引。