頁面内容改過一轮,過几天去搜尋里看,标题和摘要還是老样子;從索引里取出的片段,也仍然是更新前的版本。這種情况常被当成“没收錄”,但它更像是索引里的版本没有跟上——頁面本身已经在索引里,只是存的那份是舊的。處理之前,先把這两件事分開。
先分清“没被索引”和“索引里是舊版本”
判断方法很简單:用頁面标题或一段獨特的長句去搜,如果结果里有這個 URL,說明它已经在索引里,問题出在版本;如果完全没有,才回到發現與抓取那條线去排查。這一步不做区分,後面的動作容易用错:對着一個已经收錄的頁面反复提交,收益很低;而對真正没被索引的頁面只等更新,也等不来變化。
更新信号從哪里發出去
搜尋系統判断“這個頁面變了”,主要靠几個来源:
- 頁面本身:正文主体、标题、结构化資料出現實质改動,是最直接的信号。
- 站点地图的 lastmod:只有内容真的變了才更新這個時間;全站统一刷成同一天,等于把信号抹平。
- 站内入口:首頁或栏目頁指向它的連結文字、位置有變化,會带動重新訪問。
- 外部引用:其他站点新出現的連結,也能带来一次新的抓取。
反過来,只改模板、只調頁脚、只動了一下样式,正文没變,系統多半不會認為值得換版本。改動幅度太小,即便重新抓取,也可能沿用原来的索引内容。
重新抓取之後,還要等一次版本替換
抓取和換版本是两個動作。爬虫来了,把新内容取走;索引里換不換、什么时候換,是後面的判断。所以日誌里看到抓取,只能說明前半程走完了,不能当成收錄版本已更新的證據。给這個過程留出時間,比每天去查更省事。
提示:如果頁面在搜尋结果里的标题被改寫,先看自己给的标题是否與正文主旨偏离、是否堆了關鍵詞。這類改寫多數與收錄與否無關,不必当成收錄問题處理。
一個按顺序走的核對清單
- 搜獨特句子,確認该 URL 是否在索引里,是舊版本,還是根本没進去。
- 检查頁面主体是否真的改過,改動是否足够明顯。
- 核對站点地图里该 URL 的 lastmod,是否與實际修改時間一致。
- 確認至少有一條站内入口指向它,且連結文字能說明主题。
- 看服務器日誌,確認更新之後爬虫是否来過、取的是哪個版本。
- 如果以上都正常,就停手等待,不要反复提交或频繁改動。
几個容易帮倒忙的動作
- 把站点地图里所有 URL 的 lastmod 一次性刷成目前時間。
- 内容只改了几個字,就期待索引立刻換版本。
- 為了“促收錄”把 URL 改掉再重定向,结果新老地址一起進入待處理狀態。
- 同一篇内容留在多個地址上,让系統在几個版本之間反复挑。
如果同一主题存在多個高度相似的地址,先做收敛:留一個主版本,其余用規范連結或跳轉指過去,比逐個去催收錄更有效。索引里的版本更新,本质上是内容、信号、時間三件事對上了,急不来,也不必反复折腾。