做收錄排查时,最常听到的一句话是:“我 site 查了,没有,肯定没收錄。”但 site 查询只是查看索引狀態的一種方式,而且它返回的结果並不總是完整的。不同工具、不同時間点、不同查询方式,结果可能互相矛盾。先把“怎么查”這件事理清楚,後面的判断才不容易走偏。
收錄不是一個非黑即白的狀態
搜尋引擎内部處理一個 URL,會经過發現、抓取、解析、建立索引等多個环节。頁面可能已经被抓取,但還没進入可检索的索引;也可能已经進入索引,但因為索引分片、地域或查询语法原因,在 site 查询里没有出現。所以“有没有收錄”最好拆成几個問题:蜘蛛来過没有?頁面被解析了吗?索引里有没有這條记錄?搜尋结果里能不能查到?
几種常见查看方式及局限
site 查询
site:域名 是最快的粗筛方式,适合看網站整体收錄量級和某些目錄是否被索引。但它對精确 URL 的查询並不敏感,带參數、带目錄的查询结果经常不完整。site 结果變少,也不一定等于頁面被刪除,可能是索引更新或查询方式變化。
URL 检查工具
Search Console 的 URL 检查、Bing 網站管理員工具里的 URL 检查,能给出更具体的狀態:是否已编入索引、抓取時間、canonical 選擇等。它比 site 查询更接近單頁的真實狀態,但顯示的是工具最近一次已知的資料,不一定實时。新發布或刚改動的頁面,可能還停留在舊狀態。
服務器日誌
日誌能回答另一個問题:蜘蛛到底来没来過、什么时候来的、抓的是哪個 URL、返回碼是什么。如果日誌里完全没有记錄,那頁面可能還卡在“發現”阶段,讨论收錄没有意义。日誌和索引报告结合看,才能区分“没抓”和“抓了没收錄”。
索引报告與頁面报告
索引覆盖报告會按“已编入索引”“已發現但未编入”“已抓取但未编入”等狀態分组。它适合看趋势和批量問题,但每個分组里的原因說明往往比較宽泛,需要结合具体 URL 和日誌去判断。
结果對不上的几個常见原因
- 索引分片和查询范围:索引分布在多台机器上,site 查询只返回其中一部分结果,尤其当域名下 URL 數量很大时。
- 地域和語言版本:同一頁面在不同地区或語言版本下,索引狀態可能不同,查询时看到的只是目前环境的结果。
- 規范化選擇了別的 URL:頁面被抓取,但 canonical 或重定向把索引信号归到了另一個地址,原 URL 查不到並不奇怪。
- 頁面被合並或替換:内容高度相似的多個 URL,可能只有一個留在索引里,其余被当作重复版本處理。
- 資料延迟:索引狀態更新有延迟,刚提交或刚修改的頁面,几分钟内查不到是正常現象。
建立自己的判断顺序
- 先看服務器日誌,確認蜘蛛是否訪問過目标 URL,返回碼是否正常。
- 再用 URL 检查工具看單頁狀態,注意它顯示的抓取時間和 canonical。
- 接着查索引覆盖报告,看頁面落在哪個狀態分组,是“已發現”還是“已抓取未编入”。
- 最後用 site 查询或直接搜尋标题、獨特句子做交叉驗證,但不要只依赖這一種结果。
把這几種方式当成不同角度的證據,而不是互相替代的開關。單獨一種工具说“没有”,不等于頁面一定没被收錄;單獨一種工具说“有”,也不代表它能在搜尋结果里稳定出現。排查收錄問题时,先确定卡在哪一步,再决定要不要動内容、内鏈或提交方式,比反复 site 查询更有效。