站点做大之后,最容易失控的往往不是正文,而是那些由模板自动生成的页面:列表分页、标签聚合、站内搜索结果。它们共同的特点是数量随内容增长而增长,页面之间高度相似。如果全部放开让蜘蛛抓,抓取配额会被大量重复地址消耗;如果一刀切全部屏蔽,又可能顺手砍掉真正有价值的入口。
分页:它是路,不完全是内容
分页通常出现在栏目列表、文章归档这类位置。它的价值主要在导航:蜘蛛顺着第一页到第二页、第三页,才能摸到更早发布的详情页。所以分页一般建议保留可抓取,分页链接用标准的 a 标签输出,而不是只靠点击事件或滚动加载来切换。
需要注意的是,分页页面本身很难有独立价值,也不太适合当成落地页去经营。它更像是通道,通道要畅通,但不必在上面堆内容。
标签页:先看它是不是“有内容的聚合”
标签页大致分两种。一种是编辑手工挑选、围绕固定主题持续维护的聚合页,这类页面通常有自己的说明文字、有稳定的内容量,可以当作正常栏目页对待。
另一种是系统根据文章标签自动生成的页面,作者随手打一个标签就多出一个地址。这类页面往往只有一两条内容,标题和描述高度雷同,数量还随发文不断增长。它们的处理原则是:能合并就合并,不能合并就限制索引,不要让它无限制繁殖下去。
站内搜索结果页:默认属于该挡住的那一类
站内搜索页的数量几乎是无穷的。用户可以搜任何词,还能叠加筛选条件、翻页、排序,每一种组合都可能生成一个新地址。
- 页面内容由用户查询词决定,站点很难控制质量;
- 同一批结果会因为参数不同而反复出现;
- 蜘蛛一旦顺着搜索框爬进去,很容易陷入参数组合的循环。
常见做法是用 robots.txt 挡住搜索路径的抓取,同时对已经被抓到的搜索页加 noindex。需要提醒的是,这两件事作用范围不同,挡住抓取并不等于地址会从索引里消失,具体还要看它有没有被别处链接引用。
判断留还是挡,先问四个问题
- 它有没有独立内容?如果去掉列表本身,页面没有任何自己的文字或说明,价值通常偏低。
- 用户会不会主动搜它?有稳定搜索需求的聚合页值得保留;纯粹为了让蜘蛛有东西可爬而生成的,则不值得。
- 它和已有页面重合多少?大量地址指向同一批内容时,索引还要额外做筛选,留下一个清晰版本更省事。
- 数量可控吗?十万个自动标签页和十个手工栏目,管理成本完全不是一回事。
几种处理方式的适用范围
- 保留抓取、允许索引:适合有独立说明、内容量稳定、确实有搜索需求的聚合页。
- 保留抓取、加 noindex:适合需要充当导航路径、但本身不值得进索引的分页或过渡页。
- robots.txt 挡住抓取:适合参数组合无穷、抓了也没有意义的地址,比如站内搜索与多条件筛选。
- canonical 指向主版本:适合多条路径指向同一批内容的场景,注意被指向的页面本身要可索引。
几个容易忽略的细节
第一,屏蔽之前先确认这些页面没有被内链或导航引用。如果首页还挂着指向被屏蔽地址的链接,蜘蛛会反复撞上死路。第二,处理方式要跟站点规模匹配:小站几十个标签页不必大动干戈,大站则需要从模板层面统一规则,而不是逐页去改。第三,任何调整都要留出观察期,抓取和索引的变化通常不会当天就显现出来。
这类页面的核心问题不是“能不能被抓”,而是“值不值得占一个索引名额”。把数量控制住、把规则收敛到模板层,比事后逐个清理要省力得多。