入口页上线之后,很多人第一件事就是想给它加个 noindex,理由通常是“不想让这个页面出现在搜索结果里,只希望搜索蜘蛛顺着链接爬到目标URL”。这个想法本身不算错,但如果把 noindex 当成“隐藏页面但保留链接”的开关,就容易踩坑。它管的和你想要的事,其实不是同一件。
noindex 到底管什么
noindex 是一个指令,作用对象是当前这个页面本身。它告诉搜索引擎:这个 URL 可以抓,但不要把它放进索引、不要在搜索结果里展示它。
它没有表达“不要跟进页面里的链接”,也没有表达“不要抓这个 URL”。这两件事分别属于 nofollow 和 robots.txt 的范畴。
所以一个带 noindex 的入口页,在搜索引擎眼里仍然是“可以访问、可以读内容、可以顺着里面的链接走”的页面,只是这个入口页自己不参与检索展示。
入口页里的链接还会被跟进吗
这是最容易被误解的地方。带 noindex 的页面,页面内的普通链接默认仍是可跟进的,搜索蜘蛛读到链接后依然可能去抓目标URL。但这里有几个现实的变量:
- noindex 页面长期不进索引,搜索引擎对这个 URL 的抓取需求会逐渐下降,抓取频次可能变少,链接被发现的机会随之减少。
- 如果入口页同时被 robots.txt 屏蔽,搜索引擎根本抓不到页面内容,也就读不到里面的链接,noindex 反而变得毫无意义——因为进不了索引的页面本来就不需要 noindex。
- noindex 和 nofollow 同时写在页面级 meta 上时,链接的跟进会被明确抑制,这时候入口页基本就失去了“铺链接”的作用。
换句话说,noindex 不等于 nofollow,两者是独立的两件事,写在一起才会互相影响。
三者作用范围对照
- robots.txt:控制“能不能抓这个路径”。属于抓取层面,写在站点根目录。被屏蔽的 URL,搜索引擎看不到内容,自然也看不到页面里的链接。
- noindex:控制“抓到了之后要不要进索引”。属于索引层面,通常写成 meta 标签或响应头。
- nofollow:控制“页面里的链接要不要跟进”。既可以写成页面级 meta,也可以写单个链接的 rel 属性。
三者的层级是从外到内:先能抓,再谈索引,最后谈链接跟进。顺序搞错,设置就会互相打架。
入口页加 noindex 的动机与风险
常见的动机有两个。一是担忧入口页内容质量不高,怕拉低整站评价;二是希望入口页只当“跳板”,不想让它占用检索位置。
这两种考虑可以理解,但要注意后果:
- 如果入口页本来就要靠搜索蜘蛛频繁来访来传递链接,noindex 之后抓取频次下降,铺垫的效果会被削弱。
- 如果入口页本身已被判定为低质内容,加 noindex 只是让它不展示,并不能改变站点的整体质量结构。
- 如果入口页同时承担着给用户看的角色(比如带导航、带说明的聚合页),noindex 会让这页永远拿不到自然搜索流量。
更麻烦的是配置冲突:robots.txt 屏蔽 + noindex 同时存在时,搜索引擎抓不到页面,就看不到 noindex,结果页面仍可能被索引进结果——只是展示的是无描述的空结果。这是很常见的翻车场景。
更稳妥的判断方式
可以先问自己一个问题:这个入口页存在的目的是给人看,还是给爬虫看?
- 纯粹给爬虫铺链接、不指望用户访问的页面,一般不需要额外加 noindex,重点是保证它可抓、可读、链接可解析。
- 确实不希望出现在搜索结果里、但又希望链接被跟进的页面,可以用 noindex,但要接受抓取频次可能下降的现实,并且不要再用 robots.txt 去屏蔽它。
- 既不想被索引、也不想被跟进链接的页面,那它在蜘蛛池里基本没有存在价值,可以直接去掉。
把 noindex 当成“万能开关”是最常见的误区。它只解决“索引”这一个问题,抓取和链接跟进各归各的指令管,配置前先想清楚你要控制的是哪一层。
最后提醒一句:任何标签都只是表达意图,搜索引擎是否按你的意图执行、以多快的速度执行,都不由这些标签单方面决定。入口页的链接能否被发现,最终还是取决于页面可访问性、结构清晰度和站点的整体抓取状况。