内容改完了,过几天去搜,结果还是旧标题、旧摘要,甚至点进去是几个月前的正文。这种情况很常见,但原因往往不在“搜索引擎不收录”,而在更靠前的某个环节。把“旧版”拆开看,排查会快很多。
一、“旧版”至少分三层
同样是“没更新”,分别对应不同的处理方式:
- 抓取层旧:蜘蛛最近根本没来抓,或者来了只抓了首页,更新后的 URL 还没被重新访问。
- 索引层旧:抓到了新内容,但索引里保留的仍是上一版正文或标题,需要下一次刷新才会替换。
- 展示层旧:索引其实已经更新,只是搜索结果页的缓存摘要还没跟上,这种情况过一段时间会自己变。
分不清这三层,就容易做出错误动作:明明只是展示延迟,却去改 canonical、加 noindex,反而把收录搞乱。
二、确认顺序:日志 → URL 状态 → 页面本身
- 先在服务器日志里找这个 URL 最近一次被抓的时间、返回码和抓取到的那一版大小。如果最近几天没有记录,问题在抓取层。
- 再看 URL 的索引状态,确认“已抓取的版本”和你线上的版本是否一致。一致但展示没变,多半是展示层。
- 最后核对页面本身:是不是被 CDN、页面缓存或前端框架挡住了,导致蜘蛛拿到的 HTML 还是旧的。
三、重新抓取的节奏由什么决定
- 更新幅度:换掉整段正文,和只在页脚改个日期,重抓优先级完全不同。
- 页面地位:入口多、点击多、更新稳定的页面,重访更勤;孤岛页可能要等很久。
- 更新频率是否稳定:长期固定节奏更新的栏目,比偶尔大改一次的页面更容易被规律抓取。
- 站点抓取配额:站内可抓 URL 太多时,单个页面的重抓会被摊薄。
四、更新之后,比较稳妥的几件事
- sitemap 里的 lastmod 如实反映内容改动,不要每次生成都刷新一遍。
- 从首页、栏目页或相关文章给出链接入口,让新版本有路径被发现。
- 确属实质更新时再提交该 URL;同一地址反复提交没有额外收益。
- 避免为了“催更新”而做无意义的字段调整,改动越多越杂,反而让页面质量信号变模糊。
五、几种容易被当成“没更新”的情况
页面上线了新版本,但模板缓存、CDN 边缘节点还在返回旧 HTML,蜘蛛和用户看到的都是旧的那一份。
- 只在正文里加了一句话,搜索引擎判断变化不大,可能不会立刻重抓。
- 只改了 meta description,它本来就不保证被采用,展示没变不代表索引没更新。
- 正文靠 JS 渲染,蜘蛛执行脚本拿到的内容与你浏览器里看到的版本不一致。
- 页面套用了同一套模板文案,主体部分差异很小,容易被当成低变化页面。
六、预期要放合理
内容更新属于间接信号,不是提交即生效的开关。能控制的是:内容确实变了、变化能被访问到、入口清晰、更新节奏稳定。剩下的是抓取与索引自己的安排。与其天天查有没有更新,不如先把这几个前提做扎实,再按周观察一次。