内容更新是运营里很常见的事:改了标题、补了段落、更新了價格或參數,但過了一阵去搜,结果頁上還是舊标题、舊摘要,甚至快照里的正文也是舊版。這種情况容易被当成「没收錄」,其實更多时候是已经被收錄,只是索引没有跟着更新。這两件事的排查方向完全不同。
先分清:没重抓,還是抓了没重新索引
搜尋引擎對已收錄頁面的處理大致是「抓取—解析—重新索引」。更新後長時間没動静,通常卡在前两步之一:
- 没有重抓:爬虫還没再来,索引里保留的就是上一次抓到的版本。
- 抓了但没更新索引:頁面變化太小,或改動被認為不重要,系統判断沿用舊版本即可。
判断方法不复杂:看服務器日誌里這個 URL 最近的抓取時間,再用站長的 URL 检查工具看上次抓取時間和已编入索引的版本。如果上次抓取時間還停留在更新之前,問题在抓取;如果抓取時間已经在更新之後,但展示内容没變,問题就出在重新索引的判断上。
為什么更新了,索引却没跟上
抓取優先級被其他頁面占走
站点越大,爬虫分配到單個頁面的抓取次數越少。一個半年才更新一次的内頁,本来就不會被频繁訪問。更新之後如果没有新的入口或信号,它仍然排在抓取队列的後面。
改動幅度太小
只改了一個标点、換了個別词,或者調整了不影响语义的排版,系統很可能認為頁面主体没變。反之,正文新增一段、價格和參數變化、标题重寫,才算得上實质更新。
時間信号不准确
很多站点在模板里寫死發布時間,或用构建時間当更新時間,導致 sitemap 里的最後修改時間和頁面顯示的日期長期不變。爬虫拿不到「這頁确實改了」的信号,自然没動力優先回訪。
推動重新抓取的實际顺序
- 確認頁面本身可訪問、可索引:返回碼正常、没有被 robots.txt 挡住、没有 noindex,canonical 指向自己。基础條件不满足,後面做什么都白費。
- 更新最後修改時間:頁面上顯示的時間、sitemap 里的時間字段、结构化資料里的修改時間保持一致,並且真實反映這次改動。
- 补一個站内入口:從首頁、栏目頁或相關文章里加一條指向该頁的連結,锚文本與更新後的内容對應。已有的入口連結如果锚文本過时,一並改掉。
- 在 sitemap 中重新提交:只提交真正更新過的 URL,不要每次全量重推,那样反而削弱時間字段的可信度。
- 用 URL 检查工具手動提交:适合重点頁面,但不要当成日常手段,也不要在一天内反复提交同一個地址。
更新的目的是让頁面内容更好地回答搜尋需求,不是為了制造「改過」的痕迹。為了触發重抓而频繁微調标题、段落顺序,通常没有正向作用,還可能让頁面顯得不稳定。
几個常见誤区
- 反复改标题就能加快刷新:标题是重要的展示元素,但频繁改動會让系統难以判断頁面的稳定主题,效果可能相反。
- 刪除頁面再重建更快:新 URL 要重新经歷從發現到收錄的全過程,舊 URL 积累的信号也丢了,通常更慢。
- 抓取次數多就等于索引會更新:抓取只是前提,是否更新索引還取决于改動幅度和頁面质量。
- 所有頁面都值得推:低质量、無搜尋需求的内頁更新後刷不刷新,對站点整体影响很小,不必花精力。
更新时可以顺手检查的几項
- 结构化資料里的日期、價格、库存等字段是否同步更新,避免舊資料留在代碼里。
- canonical、hreflang 指向是否仍然正确,尤其是改過 URL 或合並過内容的頁面。
- 頁面上的内部連結有没有指向已经刪除或改名的地址。
- 如果是批量更新,检查模板有没有在多個頁面重复輸出相同的修改時間,那样等于没有時間信号。
最後要接受一個事實:索引刷新没有固定的時間表,取决于頁面的重要程度、更新幅度和站点整体被抓取的频率。能做的部分是把抓取入口、時間信号和内容质量准备好,剩下的交给系統自己判断。如果更新後長時間毫無動静,先回到第一步查可抓取性,而不是不停改動頁面。