网站收录

站内搜索页与筛选组合页被大量收录:入口、参数与收口的排查顺序

站内搜索页和筛选组合页被收录,往往不是单条 URL 的问题,而是入口设计与参数叠加的结果。本文按“先看规模、再管入口、后用 noindex 收口”的顺序,说明哪些搜索页值得保留、哪些该退出索引,以及收口后如何验证。

网站收录

站内搜索页与筛选组合页被大量收录:入口、参数与收口的排查顺序

站内搜索页、筛选页、排序页被收录,是收录报告里比较隐蔽的一类问题。单条 URL 看起来没毛病,但组合起来可能是几千上万个低价值地址,既占用抓取资源,也让索引里出现大量近似页面。

先看规模,再决定怎么处理

在动手之前,先取一份样本,判断问题有多大的量级。常见的入口有四类:

  • 站内搜索框用 GET 提交,关键词直接拼进 URL;
  • 筛选、排序、视图切换用的是可抓取的 a 标签,而且参数可以无限叠加;
  • 分页参数与筛选参数组合,产生大量只有细微差别的地址;
  • 这些 URL 被站内其他页面、外部分享或抓取工具带到搜索引擎面前。

如果样本里绝大部分页面内容相近、没有独立价值,处理方向就是收口;如果其中一部分对应真实需求,就要单独留下来。

处理顺序:先管入口,再管状态与索引信号

第一步,减少新入口

搜索引擎发现 URL 的主要渠道仍然是链接。把筛选、排序这类交互改成按钮或表单提交,能给新地址的出现降速;表单尽量用 POST,避免参数进入 URL。在链接上加 rel="nofollow" 只能降低发现概率,不能替代后续处理。

第二步,用 noindex 处理已收录页面

要让已经进入索引的页面退出,靠的是 noindex,而不是 robots.txt 屏蔽。屏蔽抓取之后,搜索引擎读不到 noindex,页面可能以“无摘要”的形式长期留在结果里。

顺序上要记住:能被抓取、能读到 noindex,才有机会被移除。先屏蔽再指望消失,通常是反的。

第三步,canonical 不是移除工具

canonical 用于合并近似版本的信号,它不保证页面直接退出索引。对于确实不该出现的搜索页,noindex 更直接;对于只是参数重复的版本,可以先用 canonical 指向主版本,再观察报告变化。

哪些搜索页值得保留

如果某个筛选组合本身有稳定的需求,比如城市、品类、价格区间这类结构化维度,那它更接近一个正常的列表页:有独立结果集、内容相对稳定、标题可以单独写。这类页面可以保留,但要控制组合数量,只开放少数几个维度,并给页面补上说明文字与合理内链,避免整页只剩一列链接。

收口之后怎么验证

  • 索引报告里带搜索参数的 URL 数量是否在回落;
  • 抓取统计中带搜索参数的请求占比是否下降;
  • 日志里蜘蛛对新参数组合的访问量是否减少;
  • 抽查几个代表性 URL,确认返回的是 noindex,而不是 403、404 之类的拦截状态。

这类问题通常不是一次处理就结束的。参数组合会随着运营活动反复出现,比较稳妥的做法是把它写进上线检查清单:新增一个筛选维度或搜索入口时,先想清楚这个维度要不要被收录,再决定链接怎么放、页面怎么标。