做蜘蛛池和站点运营时,经常有人问:入口页要不要加 noindex?加了之后,挂在里面的目标 URL 是不是就没人发现了?先说结论:noindex 管的是“这一页要不要进索引”,不等同于“搜索蜘蛛要不要顺着链接往下抓”。这两件事由不同机制控制,混在一起想,很容易做出反向操作。
noindex 是索引指令,不是抓取指令
noindex 的作用是告诉搜索引擎:不要把这一页放进索引。而搜索引擎要执行这条指令,前提是先抓到这一页、读到 meta 标签或 HTTP 响应头。也就是说,蜘蛛必须先按常规流程把入口页抓下来。页面既然已经被抓下来了,HTML 里的链接就进入了正常的解析环节——除非你另外用 nofollow 或 robots.txt 把它挡住。
为什么有人觉得“加了 noindex 链接就废了”
这个说法通常来自两件事被混为一谈:抓取发现和权重传递。
发现层面:链接照常被跟踪
主流搜索引擎的口径是,noindex 页面上的链接仍然会被跟踪和发现。也就是说,入口页加 noindex,目标 URL 依然有机会被搜索蜘蛛顺着抓一遍,进入“已发现”状态。
权重层面:别指望它和正常页面一样
搜索引擎多次表示,noindex 页面上的链接在排序信号上会被打折甚至忽略。所以如果你的目的是靠入口页给目标 URL 传一点权重,那加 noindex 基本是反向操作。入口页适合承担“让蜘蛛发现 URL”的任务,不适合同时承担“传递权重”的期待。
meta 标签和 X-Robots-Tag 的差别
两者都能下发 noindex。区别是 HTTP 头在页面还没被解析时就能读到,对 PDF、图片这类非 HTML 资源更适用。但无论用哪种方式,只要页面本身返回 200 且允许抓取,里面链接的解析流程不变。
noindex 和 nofollow 一起加会怎样
- 只加 noindex:页面不进索引,链接仍可能被跟踪,目标 URL 有机会被发现。
- 只加 nofollow:页面可以正常收录,但链接不被跟随,靠这一页几乎发现不了目标 URL。
- 两个都加:页面不收录、链接也不跟随,这一页对目标 URL 基本只剩占位作用。
- robots.txt 屏蔽 + noindex:两者互相打架。被屏蔽的页面蜘蛛抓不到,也就读不到 noindex,常见结果是页面仍以“仅 URL”形式出现在索引里。
几种常见配置该怎么选
- 想让目标 URL 被更快发现、又不想入口页占索引位:入口页加 noindex,不要加 nofollow,同时确认 robots.txt 允许抓取。
- 入口页本身是有价值的聚合页:不加 noindex,让它正常参与索引,链接也正常跟随。
- 入口页只是自己看的测试页:直接用 robots.txt 或密码保护挡住,别指望它做发现。
- 想靠入口页传权重:不要加 noindex,把精力放回页面内容和链接相关性上。
自查:怎么确认蜘蛛确实跟到了
- 看服务器日志:入口页被某个搜索蜘蛛抓取后,同一 UA 有没有在相近时间访问目标 URL。
- 看目标 URL 的状态:只发现不抓取、抓取了不索引,是两种不同的问题,要分开排查。
- 用搜索引擎官方的 URL 检查或覆盖率报告交叉验证,确认指令被正确读取。
- 小范围测试:拿一个不影响主站的页面改配置,观察几天日志再决定是否全站调整。
把“发现”和“收录”拆开看:发现靠链接和提交,收录靠内容质量和站点整体表现。noindex 只影响后者,不要指望它顺便改变前者。