網站收錄

内容更新了,搜尋结果還是舊版:推動索引刷新的排查顺序

頁面内容明明改過,搜尋结果里却還是舊的标题、摘要或正文。這種情况多半不是没收錄,而是索引没有跟着更新。本文先区分「没重抓」和「抓了没重新索引」,再给出更新最後修改時間、补站内入口、重新提交 sitemap 等可操作的排查顺序,並列出几個常见誤区。

網站收錄

内容更新了,搜尋结果還是舊版:推動索引刷新的排查顺序

内容更新是运营里很常见的事:改了标题、补了段落、更新了價格或參數,但過了一阵去搜,结果頁上還是舊标题、舊摘要,甚至快照里的正文也是舊版。這種情况容易被当成「没收錄」,其實更多时候是已经被收錄,只是索引没有跟着更新。這两件事的排查方向完全不同。

先分清:没重抓,還是抓了没重新索引

搜尋引擎對已收錄頁面的處理大致是「抓取—解析—重新索引」。更新後長時間没動静,通常卡在前两步之一:

  • 没有重抓:爬虫還没再来,索引里保留的就是上一次抓到的版本。
  • 抓了但没更新索引:頁面變化太小,或改動被認為不重要,系統判断沿用舊版本即可。

判断方法不复杂:看服務器日誌里這個 URL 最近的抓取時間,再用站長的 URL 检查工具看上次抓取時間和已编入索引的版本。如果上次抓取時間還停留在更新之前,問题在抓取;如果抓取時間已经在更新之後,但展示内容没變,問题就出在重新索引的判断上。

為什么更新了,索引却没跟上

抓取優先級被其他頁面占走

站点越大,爬虫分配到單個頁面的抓取次數越少。一個半年才更新一次的内頁,本来就不會被频繁訪問。更新之後如果没有新的入口或信号,它仍然排在抓取队列的後面。

改動幅度太小

只改了一個标点、換了個別词,或者調整了不影响语义的排版,系統很可能認為頁面主体没變。反之,正文新增一段、價格和參數變化、标题重寫,才算得上實质更新。

時間信号不准确

很多站点在模板里寫死發布時間,或用构建時間当更新時間,導致 sitemap 里的最後修改時間和頁面顯示的日期長期不變。爬虫拿不到「這頁确實改了」的信号,自然没動力優先回訪。

推動重新抓取的實际顺序

  1. 確認頁面本身可訪問、可索引:返回碼正常、没有被 robots.txt 挡住、没有 noindex,canonical 指向自己。基础條件不满足,後面做什么都白費。
  2. 更新最後修改時間:頁面上顯示的時間、sitemap 里的時間字段、结构化資料里的修改時間保持一致,並且真實反映這次改動。
  3. 补一個站内入口:從首頁、栏目頁或相關文章里加一條指向该頁的連結,锚文本與更新後的内容對應。已有的入口連結如果锚文本過时,一並改掉。
  4. 在 sitemap 中重新提交:只提交真正更新過的 URL,不要每次全量重推,那样反而削弱時間字段的可信度。
  5. 用 URL 检查工具手動提交:适合重点頁面,但不要当成日常手段,也不要在一天内反复提交同一個地址。
更新的目的是让頁面内容更好地回答搜尋需求,不是為了制造「改過」的痕迹。為了触發重抓而频繁微調标题、段落顺序,通常没有正向作用,還可能让頁面顯得不稳定。

几個常见誤区

  • 反复改标题就能加快刷新:标题是重要的展示元素,但频繁改動會让系統难以判断頁面的稳定主题,效果可能相反。
  • 刪除頁面再重建更快:新 URL 要重新经歷從發現到收錄的全過程,舊 URL 积累的信号也丢了,通常更慢。
  • 抓取次數多就等于索引會更新:抓取只是前提,是否更新索引還取决于改動幅度和頁面质量。
  • 所有頁面都值得推:低质量、無搜尋需求的内頁更新後刷不刷新,對站点整体影响很小,不必花精力。

更新时可以顺手检查的几項

  • 结构化資料里的日期、價格、库存等字段是否同步更新,避免舊資料留在代碼里。
  • canonical、hreflang 指向是否仍然正确,尤其是改過 URL 或合並過内容的頁面。
  • 頁面上的内部連結有没有指向已经刪除或改名的地址。
  • 如果是批量更新,检查模板有没有在多個頁面重复輸出相同的修改時間,那样等于没有時間信号。

最後要接受一個事實:索引刷新没有固定的時間表,取决于頁面的重要程度、更新幅度和站点整体被抓取的频率。能做的部分是把抓取入口、時間信号和内容质量准备好,剩下的交给系統自己判断。如果更新後長時間毫無動静,先回到第一步查可抓取性,而不是不停改動頁面。