撤掉 noindex 之后,先别急着反复提交
很多页面被加上 noindex 是为了临时下架、活动结束或内容整改,等条件成熟再放行。但放行之后常见的情况是:等了一两周,搜索结果里仍然看不到这个页面。这时候容易怀疑是「没提交」「没被发现」,实际上多数问题出在放行动作没有完整生效。noindex 只是若干限制信号中的一个,它撤掉了,别的环节还可能挡着。
核对顺序:从原始响应开始
第一步,确认 noindex 真的不在响应里了
noindex 可以出现在两个位置:HTML 的 meta robots 标签,以及 HTTP 响应头里的 X-Robots-Tag。只改模板里的 meta 却忘了响应头,或者反过来,都会让限制继续存在。抓取工具和浏览器插件看到的往往是渲染后的结果,最好直接看原始响应。
- meta 里是否还有 noindex、none 或包含 noindex 的组合值;
- 响应头里是否有 X-Robots-Tag: noindex 或 none;
- CDN、反向代理、多语言站点配置是否在网关层额外加了头。
X-Robots-Tag 的 none 等同于 noindex、nofollow,容易被忽略。部分页面在测试环境加过这类头,上线时没有清掉,放行时也容易只改了一处。
第二步,看抓取有没有真的重新发生
撤掉 noindex 本身不会立刻触发重新抓取。搜索引擎要在下一次访问这个 URL 时,才会读到限制已经解除。所以在服务器日志或抓取统计里,要确认该 URL 在放行之后有新的访问记录。
如果迟迟没有抓取,往下看入口:页面是否还有站内链接指向、是否在站点地图里、是否处在较深的目录层级。只有站点地图而没有内链的页面,重新被抓取的间隔通常更长。
第三步,检查 canonical 指向
如果 canonical 指向另一个地址,而被指向的地址仍然是 noindex,或者本身就是重复版本,本页即使放行,也可能不会被单独索引。放行之后顺带看一眼 canonical 是否自指、是否指向了正确的版本。
第四步,确认 robots.txt 与服务器层没有继续拦截
robots.txt 禁止抓取的 URL,搜索引擎无法读到页面上的 noindex 已经撤除,自然也无法据此更新状态。这两个信号方向相反,处理顺序也不能颠倒:先把抓取放开,再让 noindex 的撤除被读到。顺序反过来,会白白多等一个抓取周期。
第五步,判断页面本身值不值得被索引
放行只是把门打开,不代表一定会进来。如果页面内容单薄、与站内其他页面高度重复,或者只是筛选条件的组合结果,即使 noindex 撤掉了,也可能因为质量判断而继续留在索引之外。这类页面更适合合并、补充内容或调整入口,而不是反复提交。
处理节奏与记录方式
建议一次只改一类信号:先撤 noindex,确认响应干净;再放开抓取;然后补充内链与站点地图入口。每改一次记下时间点,按抓取周期观察,不要在同一天里反复调整,否则状态难以判断。
索引恢复通常需要经过一次抓取,再经过一次索引更新,两个环节各有自己的延迟。看到日志里有新抓取、但搜索结果还没变,属于正常的中间状态,继续等待即可。如果连续几个抓取周期后仍无变化,再回头按上面的顺序重新过一遍,重点看响应头、canonical 与站内入口这三项。
放行、抓取、索引是三件不同的事。任何一步没有走完,看到的都只是中间状态,不必急于判断放行无效。