頁面内容改過之後,搜尋结果里仍是舊标题、舊摘要、舊價格,這種“索引版本落後”的現象和“頁面没被收錄”不是一回事:地址已经在索引里,只是索引儲存的那份快照舊了。處理前先按下面的顺序核對,能少走很多弯路。
先確認搜尋结果顯示的是哪個 URL
同一份内容可能對應多個地址:带參數的老連結、http 與 https、带 www 與不带 www、大小寫或尾斜杠不同的變体。你更新的那份可能是新地址,而搜尋结果展示的是另一個舊地址,两邊内容自然對不上。
- 点開结果,看落地頁是不是你更新的那個 URL;
- 用 site: 或直接搜尋标题,看是否有多個地址同时存在;
- 如果有多個變体,先做重定向或 canonical 收敛,再谈索引更新。
检查缓存层是否還在返回舊内容
頁面文件改了,但 CDN、反向代理、頁面缓存插件、對象存储缓存仍可能吐舊版本。蜘蛛抓到的就是缓存里的舊内容,索引自然跟着舊。
- 用抓取工具或 curl 請求目标 URL,看响應里是新内容還是舊内容;
- 對比不同入口:直连源站、走 CDN、带與不带缓存參數;
- 检查 Cache-Control、Expires 與 CDN 刷新记錄,必要时主動清理缓存;
- 確認動態頁面没有被整頁静態化並缓存很久。
如果源站返回的已是新内容,只是部分邊缘节点還是舊的,通常等缓存過期即可,不必反复提交。
重新抓取需要時間,也需要有触發理由
抓取和收錄是两件事:蜘蛛来過,不代表它立刻把新版本替換進索引。索引更新依赖下一次抓取,而下一次抓取取决于頁面的重要程度、更新频率、内外鏈變化等。
- 内容更新後,检查頁面是否在站点地图里,lastmod 是否如實更新;
- 從首頁或相關栏目给出内鏈,让發現路径保持通畅;
- 如果是重要頁面,可以在搜尋资源平台提交單個 URL 的刷新請求,但不要短時間重复提交;
- 观察服務器日誌里该 URL 的抓取時間,確認蜘蛛最近一次拿到的是哪個版本。
頁面内部可能還残留舊信息
有时正文已经換了,但外层的标题、结构化資料、面包屑、Open Graph、栏目推荐位還是舊的,索引取用的正是這些位置。
- 检查 title、h1、meta description 是否同步更新;
- 检查结构化資料里的價格、日期、库存等字段;
- 检查是否被其他頁面(聚合頁、推荐位)以舊标题引用;
- 检查頁面里是否有隐藏的舊版本模块没被清掉。
更新後的驗證方式
改完之後,別只盯着搜尋结果頁反复刷新。可以按下面几点观察:
- 源站和 CDN 返回的都是新内容;
- 日誌里出現更新之後的抓取记錄;
- 索引中的标题、摘要逐步換成新版,時間長短因站点而异;
- 如果長時間没有變化,再回到前面的步骤,看是抓取没發生,還是抓到了舊内容。
索引版本更新是抓取、缓存、索引三层共同作用的结果。先把“蜘蛛拿到的是哪一版”確認清楚,再判断要不要采取動作,比反复提交刷新請求更有效。