网站收录

内容更新后索引里还是旧版本:索引刷新的核对顺序

页面内容已经改过,搜索结果里却还是旧标题、旧摘要,这多半不是没收录,而是索引保存的版本落后。本文按 URL 变体、缓存层、重新抓取、页面残留信息、验证方式五个环节给出核对顺序,帮助你判断问题出在抓取、缓存还是索引更新,避免反复提交刷新请求。

网站收录

内容更新后索引里还是旧版本:索引刷新的核对顺序

页面内容改过之后,搜索结果里仍是旧标题、旧摘要、旧价格,这种“索引版本落后”的现象和“页面没被收录”不是一回事:地址已经在索引里,只是索引保存的那份快照旧了。处理前先按下面的顺序核对,能少走很多弯路。

先确认搜索结果显示的是哪个 URL

同一份内容可能对应多个地址:带参数的老链接、http 与 https、带 www 与不带 www、大小写或尾斜杠不同的变体。你更新的那份可能是新地址,而搜索结果展示的是另一个旧地址,两边内容自然对不上。

  • 点开结果,看落地页是不是你更新的那个 URL;
  • 用 site: 或直接搜索标题,看是否有多个地址同时存在;
  • 如果有多个变体,先做重定向或 canonical 收敛,再谈索引更新。

检查缓存层是否还在返回旧内容

页面文件改了,但 CDN、反向代理、页面缓存插件、对象存储缓存仍可能吐旧版本。蜘蛛抓到的就是缓存里的旧内容,索引自然跟着旧。

  1. 用抓取工具或 curl 请求目标 URL,看响应里是新内容还是旧内容;
  2. 对比不同入口:直连源站、走 CDN、带与不带缓存参数;
  3. 检查 Cache-Control、Expires 与 CDN 刷新记录,必要时主动清理缓存;
  4. 确认动态页面没有被整页静态化并缓存很久。

如果源站返回的已是新内容,只是部分边缘节点还是旧的,通常等缓存过期即可,不必反复提交。

重新抓取需要时间,也需要有触发理由

抓取和收录是两件事:蜘蛛来过,不代表它立刻把新版本替换进索引。索引更新依赖下一次抓取,而下一次抓取取决于页面的重要程度、更新频率、内外链变化等。

  • 内容更新后,检查页面是否在站点地图里,lastmod 是否如实更新;
  • 从首页或相关栏目给出内链,让发现路径保持通畅;
  • 如果是重要页面,可以在搜索资源平台提交单个 URL 的刷新请求,但不要短时间重复提交;
  • 观察服务器日志里该 URL 的抓取时间,确认蜘蛛最近一次拿到的是哪个版本。

页面内部可能还残留旧信息

有时正文已经换了,但外层的标题、结构化数据、面包屑、Open Graph、栏目推荐位还是旧的,索引取用的正是这些位置。

  • 检查 title、h1、meta description 是否同步更新;
  • 检查结构化数据里的价格、日期、库存等字段;
  • 检查是否被其他页面(聚合页、推荐位)以旧标题引用;
  • 检查页面里是否有隐藏的旧版本模块没被清掉。

更新后的验证方式

改完之后,别只盯着搜索结果页反复刷新。可以按下面几点观察:

  1. 源站和 CDN 返回的都是新内容;
  2. 日志里出现更新之后的抓取记录;
  3. 索引中的标题、摘要逐步换成新版,时间长短因站点而异;
  4. 如果长时间没有变化,再回到前面的步骤,看是抓取没发生,还是抓到了旧内容。
索引版本更新是抓取、缓存、索引三层共同作用的结果。先把“蜘蛛拿到的是哪一版”确认清楚,再判断要不要采取动作,比反复提交刷新请求更有效。