很多站点的收录问题,不是详情页进不去,而是不该进的页面进得太多。站内搜索结果页、带筛选参数的列表页、没有任何结果的空查询页,都属于系统自动生成、数量几乎无限的地址。它们占用抓取次数,稀释索引质量,但也不意味着要一刀切全部屏蔽。
一、先分清三类自动生成页面
- 站内搜索结果页:用户输入关键词后生成的地址,内容完全由输入决定,重复度极高,通常不建议收录。
- 筛选与排序参数页:颜色、价格区间、排序方式等参数组合,可能生成成百上千个地址。其中一部分确实有用户需求,关键在于该组合是否对应独立内容与稳定搜索需求。
- 空结果页:搜索词无匹配结果时仍返回一个可正常访问的页面,内容基本只有一句提示,属于典型的薄页面。
二、判断标准:有没有独立价值
判断一个自动生成的页面该不该进索引,可以问三个问题:它是否有唯一的正文内容,而不是列表拼接;是否存在稳定的搜索需求;用户从外部搜索进来后,能否直接得到答案。三个答案都是否,就属于应当控制索引的对象。
抓取和收录是两件事。减少抓取是为了省资源,控制索引是为了防止污染,两者的取舍并不相同:对纯粹的参数组合页优先减少抓取,对内容重复但仍被内外链引用的页面优先控制索引。
三、三种处理方式怎么选
robots.txt:省抓取
适合数量巨大、无外部链接价值、也不需要传递权重的地址。要注意被 robots 屏蔽的地址依然可能被外部链接以无摘要形式收录,如果在意这一点,就不要用这种方式。
noindex:控收录
适合页面本身仍需要被用户访问、也可能被蜘蛛抓到,但不希望出现在索引里的情况。noindex 需要页面能被抓取才生效,所以不能同时用 robots.txt 把它屏蔽掉。
canonical:归并重复
适合参数页与主列表页内容高度重合、希望把权重集中到主地址的场景。canonical 是建议而不是强制指令,如果两个页面内容差异明显,效果会打折扣。
参数规整
在系统层面把无意义的排序、会话、追踪参数去掉,或统一排序参数的默认值,往往比事后用标签补救更省事,也更容易长期维持。
四、上线后的检查清单
- 用索引覆盖报告或站内检索,找出被收录的搜索页与参数页的大致数量与命名模式。
- 确认哪些筛选组合有稳定需求,保留它们,并补齐标题与正文说明。
- 其余地址按上述三种方式分层处理,避免同一批页面同时使用 robots 和 noindex。
- 在蜘蛛日志里观察这类地址的抓取占比,看是否把抓取次数让给了详情页。
- 两到四周后复查索引状态。被移除需要时间,不要求立刻见效。
五、容易踩的几个坑
- 空结果页返回正常状态码,模板又与有结果的页面一致,容易被批量当成低质页面收录。
- 只处理了搜索页,忘了移动端或另一套域名下相同的入口。
- 把 noindex 写在 robots.txt 里,这是无效的,两者属于不同机制。
- 页面加了 noindex,站内链接却照旧大量指向它,白白浪费抓取次数。
这类页面的处理目标不是“一个都不收录”,而是让索引里的地址都能对应用户的真实需求。参数和搜索页的数量会随业务变化不断新增,建议把它当成一项定期复查的工作,而不是一次性配置。