站点规模一上来,最容易纠结的不是首页和内页,而是那些自动生成的页面:标签页、分类列表页、聚合页、多条件筛选后的组合页。它们的共同点是数量大、内容由模板拼装、彼此之间大量重叠。爬虫会抓,但抓了之后要不要让它们进入索引,需要先做判断。
先分清页面类型,再谈收录
不同类型的批量页面,价值差别很大,处理方式也不该一刀切。
- 列表页:按时间或分类聚合内容,每个条目通常只有标题和摘要,主要作用是提供发现入口。
- 标签页与聚合页:围绕某个主题把相关内容聚到一起。如果标签划分清晰、内容量足够、有稳定内链入口,它本身可以是一个有价值的落地页。
- 筛选组合页:由参数组合生成,维度越多重复度越高,绝大多数组合没有独立的搜索需求。
判断“值不值得收录”的几条标准
1. 页面是否有独立内容
把模板以外的部分去掉,剩下的内容是否还能支撑起一个独立页面。如果整页只是同一个模板换了标题,或者与主分类页高度重合,它的索引价值就很有限。
2. 是否有人会主动搜这个页面
可以看两个地方:站内搜索关键词,以及页面已经获得的展示与点击。如果某个标签页长期有自然的查询流量,说明它对应真实需求,值得保留并继续完善。
3. 是否有稳定的内链入口
只能从分页深处到达、或只靠站内搜索才会出现的页面,既难被稳定抓取,也难被持续维护。没有入口的页面,放开索引的意义不大。
4. 数量是否可控
一个只有二十个标签的站点和一个有两万个标签的站点,策略完全不同。后者更接近程序化生成的页面集合,需要按维度收敛,而不是逐个判断。
常见的三种取舍
- 全部放开:短期看索引量涨得快,但会引入大量近似页面,稀释站内链接,也让后续排查真实问题更困难。
- 全部屏蔽:确实能减少重复,但也会把有实际需求的聚合页一起挡掉,等于放弃这部分入口。
- 分层处理:保留有内容、有需求、有入口的页面,其余用 noindex 或限制参数组合的方式排除,同时保留抓取路径,让爬虫能顺着列表走到真正的内容页。
分层处理更常见,代价是需要长期维护一份判断逻辑,而不是设置一次就结束。
动手前的自查顺序
- 拉一份现有索引页面的清单,按模板类型分组,看哪一类数量异常。
- 抽样检查同类页面的内容重合度,判断是独立页面还是同一模板的变体。
- 对照站内搜索词与行为数据,确认哪些页面真的被使用。
- 确定处理方式:保留、合并、加 noindex,还是只控制参数组合。三者后果不同,不要混用。
- 调整后观察抓取日志和索引状态的变化,而不是只盯着索引量这个数字。
提醒:阻止收录和阻止抓取是两件事。用 robots.txt 挡掉一整类 URL,会让爬虫读不到页面上的任何指令,也无法顺着这些页面发现更深的内容;如果目的只是不让它进索引,通常用 noindex 更合适。
小结
批量生成的页面本身不是坏东西,问题往往出在“没有判断就全部放开”。把页面按模板分组、按需求取舍,比纠结某一个标签页要不要收录更有意义。索引里的页面越接近用户真正会打开的页面,后续的抓取分配和问题排查都会更清晰。