核對收錄时,“有没有收錄”只是第一层。第二层更常见的問题是時間對不上:明明上周改過正文,工具里却顯示内容還是舊的;明明日誌里蜘蛛昨天来過,收錄狀態却没變化。這时候先別急着归因到抓取不够或頁面质量差,多數情况下是三個不同的時間被混用了同一個。
先分清三個時間分別代表什么
1. 最近抓取時間
指搜尋引擎蜘蛛上一次實际請求這個 URL 的時間,通常在抓取統計、服務器日誌或 URL 检查工具的“上次抓取時間”里能看到。它只說明蜘蛛来過,不代表這次抓到的内容已经進入索引。
2. 索引刷新時間
指索引里這個 URL 的内容被重新計算、替換的時間。它可能發生在抓取之後,也可能因為配額分配、质量判断等原因延後很久,甚至不刷新。很多人把工具里顯示的编入索引時間直接当成抓取時間,于是看到日期不動就以為蜘蛛没来,實际是抓了但没有重新入库。
3. 頁面自己声明的時間
包括 HTTP 响應头里的 Last-Modified、结构化資料里的更新時間字段、CMS 模板自動生成的更新時間,以及正文里寫死的日期。這一項由站点自己控制,也最容易被自動更新污染:侧邊栏推荐位轮換、评论數變化、訪問計數改動,都可能让整頁的 Last-Modified 每次請求都變。
三種常见错位與判断方式
- 抓取新、索引舊。日誌里昨天有抓取,索引里仍是两周前的版本。優先检查是否被抓取但判定内容無實质變化,或者頁面主体由 JS 渲染、抓到的 HTML 里没有正文。
- 抓取舊、索引新。索引時間比最近抓取時間還晚,通常是索引层自己做了重算或合並,不一定是重新抓取。此时不要反复提交,先看這個 URL 是否有其他變体被合並。
- 声明時間一直在變、内容没變。每次請求 Last-Modified 都是目前時間,會让抓取調度把它当成高频更新頁面,長期看反而占用抓取配額。
核對顺序建议
- 先確認頁面是否真的被收錄,记下索引里顯示的版本特征,比如标题、摘要、正文首段。
- 再看最近抓取時間,確認蜘蛛命中的是哪一個 URL 版本,途中是否经過重定向。
- 然後對比索引時間與抓取時間的先後,判断是抓了没重算,還是根本没抓。
- 最後检查頁面声明時間是否被模板自動改寫,必要时固定 Last-Modified,或补上明确的日期标记。
- 把上述三項记在同一張表里,观察一到两周,再决定是否需要改動内容或内鏈。
時間只是判断线索,不是结论。抓取時間和索引時間對不上时,先把它当作待驗證的假设,用日誌和頁面實际返回的内容去交叉確認。
几個容易踩的坑
- 把工具里顯示的日期当成唯一口径,不同工具、不同站点統計的時間基准並不一致。
- 頁面上把可见日期寫成当天,但正文没變,容易让用戶和蜘蛛都誤判新鲜度。
- 只看首頁或列表頁的抓取時間,忽略詳情頁自己的真實抓取记錄。
把三個時間對齐之後,很多“收錄没動静”的問题會自然分流:一類是抓取层面没排上,一類是抓到了但索引没刷新,還有一類是頁面自己把更新時間弄乱了。分清楚之後再動手,通常比反复提交和反复改内容更省事。