網站收錄

頁面改過之後,索引里的舊版本為什么還在:抓取刷新與索引更新

内容改了、搜尋结果里還是舊版本,通常不是没收錄,而是抓取刷新和索引更新還没跟上。本文把這两個环节拆開,讲清影响刷新速度的變量、可做的動作,以及几種常见的誤判情况。

網站收錄

頁面改過之後,索引里的舊版本為什么還在:抓取刷新與索引更新

把頁面标题或正文改掉,過几天在搜尋结果里看到的還是舊版本,這種情况很常见。它通常不是“没收錄”,而是抓取刷新和索引更新還没跟上。把這两個环节分開看,排查思路會清晰很多。

抓取刷新和索引更新,是两件事

蜘蛛重新訪問頁面、拿到新版本,這是抓取刷新;搜尋引擎决定用新版本替換掉索引里的舊版本,並更新摘要、标题等展示信息,這是索引更新。前者發生不代表後者立刻發生,中間可能隔着几天甚至更久。

所以当你看到舊内容還挂在那里,第一件要確認的是:蜘蛛到底有没有在新版本上线之後再来過。如果日誌里根本没有新的訪問记錄,那問题在抓取侧;如果来了、拿到的也是新版本,但展示没變,那才轮到索引侧。這两條路的處理動作完全不同。

影响刷新速度的几個變量

  • 更新幅度:整段重寫、标题大改,和只調整一個标点,被判定為“内容已變”的概率不一样。小幅改動往往更容易被延後處理。
  • 可發現性:頁面有没有稳定的内鏈入口、有没有出現在 sitemap 里、有没有被別處引用。入口越清晰,重新訪問越容易排上队。
  • 站点整体抓取节奏:站点抓取频繁时,單個頁面的刷新也會快一些;反之,一個低频站点上的内頁,等上一两周並不稀奇。
  • 頁面自身分量:被内鏈和外鏈指向較多的頁面,通常比孤立的深层頁面更快被重新訪問。
  • 服務端响應:如果蜘蛛来时遇到超时、5xx 或者被 CDN 缓存拦下舊版本,刷新就會反复失敗,表現和“没抓”很像。

改完之後可以做的動作

下面這些做法能做的是提高被重新抓取的概率,不构成任何时效承诺,也不保證索引一定會按预期刷新。

  1. 先自查新版本是否真的對外可见:清掉 CDN 或頁面缓存,用未登入狀態、換 IP 訪問一次,確認返回的是新内容,而不是被缓存的舊副本。
  2. 检查响應狀態碼和 robots 相關設定:確認頁面没有被临时屏蔽、没有誤加 noindex、没有返回 404 或 5xx。
  3. 合理更新 sitemap 的 lastmod:只有当内容确實發生變化时才更新這個時間值。為了催抓取而反复改動 lastmod,會让這個信号逐渐失去可信度。
  4. 用内鏈把新版本“推”到入口附近:從首頁或栏目頁给出指向该頁的連結,比干等更有效。連結锚文本最好和新内容主题一致。
  5. 提交前先稳定下来:短時間内反复微調同一頁,容易让蜘蛛每次拿到的都是不同版本,反而拖慢判定。

几種容易誤判的情况

  • 以為改了内容就等于触發了重抓:内容變化只是信号之一,不是開關。没有新的訪問日誌,就說明蜘蛛還没来。
  • 反复提交同一個 URL:提交動作本身不會让抓取無限加速,站点抓取容量有限,堆积的提交反而會稀释單個頁面的優先級。
  • 把展示摘要没變当成索引没更新:有时索引已经換成新版本,但摘要仍是系統從正文里抽取的舊片段组合,看起来像没變。
  • 在不同搜尋引擎之間横向比較:各自的抓取节奏和刷新周期不同,同一時間点看到的结果不一致是正常的,不必據此判断自己改“失敗”了。
判断要不要繼續等,看两個事實:日誌里有没有新版本的抓取记錄,以及抓到的内容是不是新的。有记錄且是新内容,剩下的多半是時間問题;没记錄或抓到的是舊内容,才需要回到抓取侧排查。

什么时候值得認真排查

如果更新已经過去很久,站内其他頁面都已经刷新,唯獨這一個毫無動静,就有必要查一查:頁面是否被某條規則誤伤、是否被 301 鏈條绕遠了、内鏈入口是不是在改版中被去掉了。這類结构性原因不會靠等待自行消失。

反過来,如果是全站普遍刷新慢,那多半和站点整体的抓取状况有關,盯着單個頁面折腾意义不大。先看站点层面的抓取频率、错誤率和入口结构,再回到具体頁面,顺序會更合理。