頁面内容改過之後,索引里還是舊标题、舊摘要,甚至舊正文,這種情况很常见。它不一定代表頁面“没收錄”,更常见的原因是上一次快照還没被替換。要判断下一步做什么,先把“頁面已经改了”和“搜尋引擎已经再次抓取並刷新索引”分開看。
先分清是“收錄未更新”還是“没有再抓”
在後台看到 URL 處于已收錄狀態,只說明它曾经進入過索引。索引里的版本可能是几天前甚至几周前的抓取结果。此时要看的不是收錄狀態本身,而是最近一次抓取時間、抓取到的 HTML 内容,以及頁面是否有稳定入口。如果最近抓取時間很舊,優先排查入口和抓取频率;如果最近已经抓取但索引没變,再检查頁面返回给爬虫的内容是否和浏览器看到的一致。
改動幅度不同,處理方式也不同
不是所有修改都需要立刻“催更新”。按改動幅度分三档,能减少無效操作。
- 小改動:只改了几個词、内鏈、图片 alt 或無關紧要的描述。這類改動對索引影响小,通常等下一次自然抓取即可。反复提交同一 URL,反而可能让抓取安排更混乱。
- 中等改動:調整了正文结构、價格、库存、關键段落或标题。此时要確認服務端返回的 HTML 已经是新版本,並检查内鏈和 sitemap 里的入口是否指向该頁。入口稳定,再次抓取的概率才會提高。
- 大改動:頁面主题變了、用途變了,或者從一篇文章變成了另一類内容。不要原地硬改。更稳妥的做法是新建 URL,把舊地址 301 到最相關的新地址,並同步更新内鏈。
检查服務端返回與缓存
很多时候,浏览器看到的是新内容,但爬虫拿到的是舊内容。顺序可以這样核對:
- 直接訪問目标 URL,不带追踪參數,查看返回的 HTML 源碼,而不是只看渲染後的頁面。
- 確認 CDN、反向代理或頁面缓存没有把舊版本繼續發给爬虫。
- 如果頁面依赖前端渲染,检查服務端返回的初始 HTML 里是否包含核心内容。
- 查看 Last-Modified、ETag 等响應头是否随内容更新而變化。
這一步的目的不是“骗過”抓取,而是保證爬虫和用戶看到的是同一個版本。返回不一致时,先修服務端和缓存,再谈提交。
再次抓取入口的核對顺序
確認頁面本身没問题後,再按下面顺序检查入口,不要一上来就反复提交。
- 站内是否有稳定内鏈指向该頁,且連結所在頁面本身可被抓取。
- sitemap 是否包含该 URL,lastmod 是否和實际更新時間一致。
- 栏目頁、聚合頁或相關推荐里是否有入口,避免頁面只存在于 sitemap。
- 通過站内日誌观察抓取是否已经發生,而不是只盯着索引狀態。
- 如果确實需要提交,一次提交即可,之後留出观察周期。
常见誤判
site 查询或搜尋结果里顯示舊标题,不等于頁面没有被再次抓取;它可能只是索引层還没完成刷新。同样,缓存頁面、外部快照和搜尋结果摘要也可能保留舊版本。
- 把“索引未刷新”当成“頁面被惩罚”,然後大改模板,容易伤到其他頁面。
- 短時間内反复修改标题和正文,會让抓取到的版本不稳定。
- 只看浏览器頁面,不看服務端返回,容易忽略缓存和渲染問题。
收口建议
頁面更新後,比較稳妥的做法是:一次把内容改到位,确保服務端返回新版本,保留稳定内鏈和 sitemap 入口,然後按自然抓取周期观察。如果改動很大,優先考虑新建 URL 和 301,而不是在舊地址上反复調整。這样既符合抓取與收錄的基本逻辑,也能减少来回折腾带来的判断干扰。