网站收录

站内搜索页和筛选参数被收录:从 URL 生成源头开始收敛

索引里出现大量带 q=、sort=、filter= 的地址,通常来自站内搜索页和筛选参数页。它们不是同一地址的不同写法,而是内容近似、数量可以无限增长的页面。处理时先从 URL 生成和内链源头切断,再考虑抓取与索引手段,最后看已收录条目如何收敛。

网站收录

站内搜索页和筛选参数被收录:从 URL 生成源头开始收敛

打开索引覆盖率报告或直接做一次 site 查询,看到一批带问号的地址:?q=、?sort=、?filter=、?page= 层层叠加。这些多数来自站内搜索框和各种筛选控件。它们能被收录,通常不是搜索引擎主动造出来的,而是站点自己把可抓取的入口放了出去。

先看这些地址是怎么产生的

按生成方式拆开,处理思路会清晰很多:

  • 站内搜索结果页:用户站内搜索后跳转到的地址,只要链接被输出到页面上,就可能被抓取。
  • 排序与筛选参数:列表页的排序切换、多条件筛选,每变一次就生成一个新地址。
  • 分页与筛选叠加:筛选条件再加页码,数量按乘法增长。
  • 跟踪与会话参数:来源标记、临时会话 ID 挂在地址后面。

这类页面和尾斜杠、大小写那种情况不一样。尾斜杠是同一个地址的不同写法,而参数页地址确实不同、内容也略有区别,只是主题高度近似、数量没有上限。也正因如此,它们很容易被当成独立页面进入索引。

判断哪些该留、哪些该收

不是所有参数页都该清掉。判断标准其实很简单:这个组合有没有人真的会搜,有没有独立的展示价值。

  • 有明确需求的核心筛选组合,可以考虑保留,甚至做成静态化的固定入口。
  • 由用户随意输入生成的搜索结果页,一般没有留的必要。
  • 纯排序、纯跟踪参数,通常只影响展示顺序,不影响内容主体。

处理顺序:从生成源头到索引状态

  1. 先断掉自动生成。站内搜索结果页默认加 noindex,不要让它成为可长期抓取的公开页面。
  2. 控制内链和站点地图。只要页面上的链接不指向这些组合,站点地图也不提交,抓取压力就会小很多。这一步比后面任何补救都有效。
  3. 再选抓取或索引手段,并注意冲突。robots.txt 屏蔽的是抓取,不能保证把已有条目移出索引;而被屏蔽之后,抓取工具看不到页面上的 noindex,索引里的条目可能长期保留、只剩一个没有摘要的地址。要移除索引,优先用可以抓取的 noindex。
  4. 给确有价值的多参数页面指定规范地址。canonical 指向对应的主列表页,注意目标页本身必须可抓取、可索引,否则信号会落空。
  5. 最后处理已经收录的条目。多数情况等重新抓取后自然收敛,量很少时可以用移除工具,但不要靠它解决结构性问题。
抓取控制和索引控制是两回事。屏蔽抓取往往只是让问题从报告里看不见,而不是真的解决。

收敛之后怎么验证

改动生效有滞后,观察周期按周看比较现实。可以对照三处:索引报告里相关地址的数量趋势、site 查询的结果、服务器日志里这些地址的抓取频次。三条线索方向一致,说明收敛在起作用。

它还会再长出来

参数页不是清一次就结束的事。新的筛选维度、新的排序方式、新的营销跟踪参数,都会重新生成一批地址。更稳的做法是在模板和链接输出层面控制:默认不把可组合的参数链接渲染成可抓取的 a 标签,新增参数上线前先确认它到底该不该被索引。