做收錄核對时,最常见的困惑是:site: 查询顯示的數量、索引报告里的數字、日誌里的抓取记錄,三者常常對不上。這三者本来就不是一回事,直接拿數字互相比較,很容易得出错誤结论。更稳的做法是先把口径分清楚,再按固定顺序抽查。
一、三個口径各自代表什么
site: 查询
它只反映目前搜尋條件下能检索到的结果數量,會受查询词、地区、時間、個性化以及估算方式影响。同一個站隔天查两次,结果差几倍都很正常。它适合看趋势,不适合当精确值。
索引报告
索引报告是站点級的分组統計,比如“已编入索引”“已發現,尚未编入索引”“已抓取,尚未编入索引”等。它的價值在于分類,而不是總數。看到總數波動时,要先去對應分组里找原因。
服務器日誌
日誌记錄的是抓取事實,與是否收錄没有直接關系。抓取被拒、抓取後未编入索引、抓取的是不需要收錄的 URL,都會造成“日誌很热闹、收錄没變化”。
二、核對时建议的顺序
- 先固定样本集。從各主要目錄各取若干條代表性 URL,做成一份 50–100 條的清單,覆盖首頁、栏目頁、詳情頁、分頁、带參數頁等。不要每次临时挑 URL,否則前後對比没有意义。
- 用網址检查確認頁面級狀態。對整個样本集逐條查看,记錄“已编入索引 / 已發現未编入 / 已抓取未编入 / 被排除原因”。
- 把 site: 查询只当作趋势參考。记錄數量變化即可,不必解释每一次涨跌。
- 日誌按狀態碼和頁面類型分组。200、301、404、5xx 分開看,再按目錄归類,找出抓取集中在哪些類型上。
三、三種常见的“對不上”
1. 日誌一直在抓,报告顯示“已發現,尚未编入索引”
說明發現和抓取都不缺,卡在编入环节。此时要检查的是頁面本身:内容是否過于單薄、是否與其他頁面高度重复、是否有明确的主题指向。繼續加大抓取频率通常不會改變结果。
2. 报告顯示已编入索引,site: 却搜不到
索引狀態和可检索狀態是两件事。頁面可能因為查询词不匹配、被更相關的頁面取代,或展示层過滤而搜不到。判断收錄請以網址检查為准,不要用 site: 反推。
3. site: 數量上涨,报告里没變
多半是 URL 變体被計入了統計,比如带參數、带尾斜杠、大小寫不同的地址。這類情况先去核對 canonical 與内鏈指向,把變体收敛,而不是追查“為什么收錄變多了”。
四、做一張可复用的记錄表
字段建议包含:URL、頁面類型、最近抓取時間、索引狀態、排除原因、内鏈數量、canonical 指向。每次核對只更新這張表,横向對比才有依據,也方便交接给同事繼續跟進。
同一個數字在不同工具里含义不同,先统一口径,再讨论结论。
五、什么时候该停下来
如果连續几轮核對下来,样本集里的頁面狀態没有實质變化,那就不是再查一次能解决的問题,而是内容质量、URL 規范或站点结构层面的問题。核對的目的不是把數字對齐,而是找到卡住的那一步。