站内搜索页、筛选页、排序页被收录,是收录报告里比较隐蔽的一类问题。单条 URL 看起来没毛病,但组合起来可能是几千上万个低价值地址,既占用抓取资源,也让索引里出现大量近似页面。
先看规模,再决定怎么处理
在动手之前,先取一份样本,判断问题有多大的量级。常见的入口有四类:
- 站内搜索框用 GET 提交,关键词直接拼进 URL;
- 筛选、排序、视图切换用的是可抓取的 a 标签,而且参数可以无限叠加;
- 分页参数与筛选参数组合,产生大量只有细微差别的地址;
- 这些 URL 被站内其他页面、外部分享或抓取工具带到搜索引擎面前。
如果样本里绝大部分页面内容相近、没有独立价值,处理方向就是收口;如果其中一部分对应真实需求,就要单独留下来。
处理顺序:先管入口,再管状态与索引信号
第一步,减少新入口
搜索引擎发现 URL 的主要渠道仍然是链接。把筛选、排序这类交互改成按钮或表单提交,能给新地址的出现降速;表单尽量用 POST,避免参数进入 URL。在链接上加 rel="nofollow" 只能降低发现概率,不能替代后续处理。
第二步,用 noindex 处理已收录页面
要让已经进入索引的页面退出,靠的是 noindex,而不是 robots.txt 屏蔽。屏蔽抓取之后,搜索引擎读不到 noindex,页面可能以“无摘要”的形式长期留在结果里。
顺序上要记住:能被抓取、能读到 noindex,才有机会被移除。先屏蔽再指望消失,通常是反的。
第三步,canonical 不是移除工具
canonical 用于合并近似版本的信号,它不保证页面直接退出索引。对于确实不该出现的搜索页,noindex 更直接;对于只是参数重复的版本,可以先用 canonical 指向主版本,再观察报告变化。
哪些搜索页值得保留
如果某个筛选组合本身有稳定的需求,比如城市、品类、价格区间这类结构化维度,那它更接近一个正常的列表页:有独立结果集、内容相对稳定、标题可以单独写。这类页面可以保留,但要控制组合数量,只开放少数几个维度,并给页面补上说明文字与合理内链,避免整页只剩一列链接。
收口之后怎么验证
- 索引报告里带搜索参数的 URL 数量是否在回落;
- 抓取统计中带搜索参数的请求占比是否下降;
- 日志里蜘蛛对新参数组合的访问量是否减少;
- 抽查几个代表性 URL,确认返回的是 noindex,而不是 403、404 之类的拦截状态。
这类问题通常不是一次处理就结束的。参数组合会随着运营活动反复出现,比较稳妥的做法是把它写进上线检查清单:新增一个筛选维度或搜索入口时,先想清楚这个维度要不要被收录,再决定链接怎么放、页面怎么标。